桃子桃子快讯
返回首页
模型发布

通义 Qwen3.8-Max-0902 登顶 CodeArena WebDev 榜单

通义千问 Qwen3.8-Max-0902 在 CodeArena 的 WebDev 排行榜中跃居第一,分数从 1669…

2026.09.02 · 周三2 分钟阅读

通义千问 Qwen 团队宣布,其最新版本 Qwen3.8-Max-0902 在 CodeArena 的 WebDev 排行榜上跃居第一,分数从 1669 提升至 1691,刷新该榜单在智能体编码(agentic coding)方向上的纪录。消息由通义千问官方在 X 平台发布,并@了 Arena 团队以示致谢。

榜单成绩

Qwen3.8-Max-0902 在 WebDev 维度上的得分较此前提升 22 分,最终达到 1691。WebDev 榜单重点考察模型在网页开发全流程中的综合表现,涵盖多步任务规划、工具调用以及端到端应用生成等能力。

官方总结了三个核心优势:

  • 多步推理(multistep reasoning)
  • 工具调用(tool use)
  • 完整应用生成(full app generation)

智能体编码成竞争焦点

随着 AI 编程从单段补全向端到端应用构建演进,WebDev 类基准正成为衡量大模型实用能力的重要指标。Qwen3.8-Max-0902 在该榜单登顶,意味着通义千问在智能体编码方向与全球头部厂商展开正面角逐,也进一步巩固了其在中文大模型编程赛道中的位置。

待观察

目前官方尚未公布 Qwen3.8-Max-0902 的具体发布日期、详细技术规格以及与前代版本的差异,后续值得关注的包括该版本在其他编程基准(如 SWE-bench、HumanEval 等)上的表现,以及面向开发者的 API 接入方式与定价策略。

信源