Qwen3.8-27B 开源:消费级显卡跑出「Opus 级」Agent
通义千问 Qwen3.8-27B 正式开源,27B 参数在 SWE-bench Pro、CoWorkBench 等榜单上…
通义千问正式开源 Qwen3.8-27B 模型。这是一款总参数量为 270 亿的中等尺寸大模型,主打编程、专业工作、研究以及长程 Agent 任务,原生支持多模态与 262K Token 上下文,并可扩展至 100 万 Token。官方在多份榜单上对标 Claude Opus 4.6 Max,多项成绩实现反超;而在量化后,24GB 显存的 RTX 3090 / 4090 等消费级显卡即可将整模型装进本地运行,引发开发者社区广泛关注。
代码与 Agent 榜单反超 Claude Opus 4.6 Max
在编程能力评测 SWE-bench Pro 中,Qwen3.8-27B 比 Claude Opus 4.6 Max 高出 8.3 分;在面向真实软件工程的 QwenSWEBench 上,领先幅度进一步扩大到 15.2 分。在考察长任务表现的 Agent 评测 CoWorkBench(覆盖计算机、金融、法律、医疗等专业场景)中,Qwen3.8-27B 取得 70.7 分,同样高于 Opus 4.6 Max 的 68.2 分。
Agent 操作类基准上,27B 模型的表现更为突出:
- 电脑操作 OSWorld-Verified:84.3 分 vs Opus 4.6 Max 72.7 分
- 手机操作 AndroidWorld:81.9 分 vs Opus 4.6 Max 62.0 分
- 浏览器操作 WebArena-Verified:64.8 分,相较上一代 48.8 分有明显提升
原生多模态与视觉推理
Qwen3.8-27B 并非纯文本模型,自身内置视觉理解与解析能力,可直接读图、阅读 PDF、理解图表,并具备视频处理能力。在视觉数学问题解决能力评测中,开启 CI(Consistent Inference)后得分达 94.6 分,为同档位可见模型中的最高成绩;在通用视觉推理上,开启 CI 后得分 85.6 分,相比未开启 CI 时的 65.7 分提升显著。这意味着模型不仅能「看见」,还能进一步理解图形、公式与空间关系,做出判断。
架构细节与长上下文设计
为了在较小体积下支撑长程 Agent 任务,Qwen3.8-27B 共 64 层,其中 48 层采用 Gated DeltaNet 线性注意力,16 层保留完整 Attention,整体按「三层线性注意力 + 一层完整 Attention」的节奏循环。线性注意力负责降低长序列下的计算与缓存压力,完整 Attention 则周期性进行深层语义交互,使模型原生支持 262K Token 上下文,并可扩展至 100 万 Token。
在推理机制上,模型默认开启 Thinking 模式,并提供 reasoning_effort 参数,支持 xhigh、medium、low 三档推理深度调节;Thinking 也可被完全关闭,让模型跳过显式推理直接回答,针对不同任务在速度与质量之间灵活取舍。同时默认开启 preserve_thinking,使 Agent 前几轮的推理思路可保留在后续上下文中,避免长任务下重复推理,也有利于 KV Cache 的复用。
部署门槛与社区实测
Qwen3.8-27B 已接入 Transformers、vLLM、SGLang、TokenSpeed 等主流推理框架;生产环境推荐 vLLM、SGLang 等高吞吐 Serving 引擎,本地玩家可直接使用 Hugging Face 提供的量化版本。量化后 24GB 显存的消费级显卡即可加载,亦可在大内存 Mac 上运行。
社区实测方面,有开发者在单张 GH200 上以 FP8 精度同时跑 10 个真实请求(每请求最高 16K 输出、262K 上下文),首批流式 Token 基本在 10 ms 内返回,10 个请求均顺利完成。还有用户在单 GPU 上让模型识别一部 1935 年 11 分钟老电影中 96 个带时间戳的事件,157 秒完成,画面误差约 2 秒。
模型权重已在 Hugging Face 与 ModelScope 同步上线。
