Qwen3.8-27B正式开源:消费级显卡可跑“Opus级”Agent,多项基准反超Claude
摘要:Qwen3.8-27B正式开源,270亿参数配合原生多模态能力,在代码、Agent等多项基准测试中反超Claude Opus 4.6 Max。量化后24GB显存的消费级显卡即可本地部署,长上下文和多模态能力同样保留。
开源即引爆:开发者苦等的27B终于来了
Qwen3.8系列迎来了一位重点成员——Qwen3.8-27B正式开源。这款270亿参数规模的模型,早在正式发布前就已被不少开发者列入“最值得期待的开源版本”清单,社区催更的声音几乎没有停过。
大家之所以如此关注这款模型,一个非常现实的原因是:这次,本地电脑真的带得动了。
270亿总参数量意味着,经过量化处理后,拥有24GB显存的RTX 3090、4090等消费级显卡,就有机会将完整模型装入本地运行。

参数没缩水:长上下文、多模态、Agent能力全保留
体积虽小,但Qwen3.8-27B的参数配置和模型能力可一点都不“迷你”:
- 原生多模态:除了文字和代码,还能直接理解图片、PDF文档、图表,甚至处理视频
- 长上下文:原生支持262K Token上下文,可扩展到100万Token
- 重点强化方向:编程、专业工作、研究以及长程Agent任务
其中“原生多模态”非常值得单独划重点。这意味着模型能够在同一框架下同时处理文本和视觉信息,无需外挂独立的视觉模型——对于需要看图写代码、理解界面截图、解析文档的开发者来说,这是一个非常实用的能力。

代码与Agent能力:多项榜单超Claude Opus 4.6 Max
模型的实际能力,官方基准测试已经给出了一组值得关注的答案。
在代码评测方面,Qwen3.8-27B在SWE-bench Pro中比Claude Opus 4.6 Max高出8.3分;在更考验真实软件工程能力的QwenSWEBench评测中,领先幅度进一步扩大到15.2分。
Agent能力方面,在面向计算机、金融、法律、医疗等专业长任务的CoWorkBench评测中,Qwen3.8-27B取得70.7分,同样超过了Claude Opus 4.6 Max的68.2分。

多模态相关能力在这次升级中表现更为集中。在电脑操作评测OSWorld-Verified中,Qwen3.8-27B拿到84.3分,Claude Opus 4.6 Max为72.7分;手机操作评测AndroidWorld中,Qwen3.8-27B达到81.9分,而Claude Opus 4.6 Max为62.0分;浏览器操作评测WebArena-Verified则从上一代的48.8提升至64.8。
社区尝鲜:从像素游戏到“本地跑Opus级”
开源的消息一出,社区已经有不少开发者第一时间上手测试。
有开发者用Qwen3.8-27B和上一代3.6-27B分别制作了像素风宝塔效果,肉眼可见地,3.8-27B在色彩细节和主体结构上明显更细腻:

还有开发者用Qwen3.8-27B生成的俄罗斯方块小游戏——空格键掉落时的屏幕抖动、消除行时的奖励倍增器效果,都是模型自己添加的细节:

社区里已经出现一种乐观的声音:以后是否意味着可以在本地跑“Opus级”模型了?

对于AI编程爱好者来说,这确实是个值得关注的方向——当“Opus级”能力可以被消费级硬件承载,本地化编程Agent的开发门槛将被显著拉低。
关键要点
- Qwen3.8-27B正式开源,总参数270亿,量化后可在24GB显存的消费级显卡上本地部署
- 原生多模态能力支持图片、PDF、图表和视频理解,无需外挂视觉模型
- 262K原生上下文,可扩展至100万Token,适合处理大型工程
- 在SWE-bench Pro、QwenSWEBench、CoWorkBench等代码与Agent基准上均超过Claude Opus 4.6 Max
- 电脑操作、手机操作等Agent评测中领先优势明显,浏览器操作能力相比上代大幅提升
多模态能力:看图、读文档、做推理,一次到位
视觉理解方面,Qwen3.8-27B 同样有不少看点。
先看视觉数学推理。这项任务不只是识别图片里的文字,还需要把图形、公式和空间关系放在一起综合理解。开启 CI(持续思考)后,Qwen3.8-27B 拿到 94.6 分,是当前对比的一排可见模型中的最高分。
再看通用视觉推理。开启 CI 后模型得分 85.6,相比不开启时的 65.7,提升幅度相当明显。这类任务考验的是模型面对日常视觉场景时,能否从「看见物体」进一步做到「理解关系、做出判断」。
这些成绩意味着,这代 27B 模型在图像识别、文档阅读和视觉推理上覆盖的场景更广,整体表现也更扎实。

社区实测:小模型跑出大模型的体验
模型发布后,社区里的动手党们已经开始了各种实测。
有网友用 Qwen3.8-27B 做了一个贪吃蛇游戏,做完后直言:感觉像拥有了一个 Opus 级别的 Agent。

另一位网友把 Qwen3.8-27B-FP8 部署到一张 NVIDIA GH200 上,同时跑 10 个真实请求,每个请求最高输出 16K Token,上下文拉到 262K。结果显示,首批流式 Token 基本都在 10 毫秒内返回,10 个请求全部正常完成。高并发和长上下文场景下的运行稳定性,确实经得住考验。

还有网友重点测试了多模态理解能力。他一次性丢给模型一部 1935 年的 11 分钟电影,要求识别其中 96 个带时间戳的事件,并逐字引用画面中的文字。最终模型在单张 GPU 上、157 秒内完成全部识别,时间点对应到具体画面时,整部片子的误差仅约 2 秒。

推理档位:模型「想多久」,由你决定
除了榜单成绩,Qwen3.8-27B 这次还有一个相当实用的变化:推理深度可以手动调节。
模型默认开启 Thinking 模式,同时支持通过 reasoning_effort 参数调节推理深度,一共分成三档:xhigh、medium 和 low。
复杂代码生成、长程 Agent 这类任务可以拉高档位,让模型想得更深;简单问答、摘要、轻量任务则可以降下来,优先换取速度和成本优势。另外,Thinking 模式也可以直接关闭,让模型跳过推理过程、直接给出回答。
长任务友好:思考过程不「丢档」
针对长任务场景,Qwen3.8-27B 默认开启了一个非常实用的功能——preserve_thinking。
简单来说,Agent 前几轮「是怎么想的」会继续保留在后面的上下文里。比如一个 Coding Agent 连续修改十几个文件,做到后面时还能沿着前面的决策思路继续走,不用每轮重新梳理逻辑,同时也能更好地利用 KV Cache,减少重复计算。
混合架构:用更小的身形扛住更长的上下文
要把长任务稳稳扛住,底层架构也得下功夫。
Qwen3.8-27B 一共有 64 层,其中 48 层采用 Gated DeltaNet 线性注意力,16 层保留完整 Attention,整体按照「三层线性注意力 + 一层完整 Attention」的节奏循环排列。
线性注意力负责降低长序列下的计算和缓存压力,而完整 Attention 则每隔几层做一次更充分的信息交互。两者配合带来的直接好处是:Qwen3.8-27B 的原生上下文长度做到 262K Token,并且可以进一步扩展到 100 万 Token。

怎么跑起来?门槛比想象中低
最后说说大家最关心的问题:部署。
如果是生产环境或者需要高吞吐,官方推荐使用 SGLang、vLLM 这类专门的 Serving 引擎。本地玩家则更省事——Hugging Face 已经提供量化版本入口,可以直接通过熟悉的工具链部署。
换句话说,手里有一张高端消费级显卡或者大内存 Mac,基本就能开始折腾这只 27B 了。
官方开源链接已附在文末,感兴趣的读者可以直接上手试试。