桃子桃子快讯
返回首页
行业动态

Kimi K3 登顶 ErrataBench 前十,成首个突破 90% 的开放权重模型

社区用户测评显示,Moonshot 的 Kimi K3 在 ErrataBench 上突破 90%,成为首个进入前十的开…

2026.07.22 · 周三2 分钟阅读

根据社区用户在 Hacker News 上发布的 ErrataBench 基准测试结果,Moonshot AI(月之暗面)的 Kimi K3 成为首个突破 90% 分数的开放权重模型,并首次跻身该榜单前十。测试者称,Kimi K3 在性能与价格两个维度上均超过了 Claude Opus 4.8,整体表现接近「5.6 Terra 级别」,因此称这一结果是「一个里程碑」。

基准测试结果

ErrataBench 榜单长期由闭源商业模型主导,Kimi K3 是首个进入前十的开源权重模型,具体表现包括:

  • 在 ErrataBench 上首次以开放权重身份突破 90% 分数
  • 同时在性能与价格两个轴上击败 Opus 4.8
  • 综合性能接近「5.6 Terra 级别」

测试者评价,对于在本地运行模型、且硬件条件允许的用户而言,Kimi K3 在英文写作与编辑相关任务上是目前「最佳选择」。

ErrataBench 是什么

ErrataBench 是一项面向大模型英文写作与编辑能力的基准测试,重点考察两个核心能力:

  • 在大段文本中识别错误(spot errors)
  • 使用工具引入有效修改(introduce valid fixes using tools)

也就是说,该基准衡量的是模型在长文本校对与工具辅助编辑场景中的综合表现,对内容创作、文档审校、技术写作等任务具有参考意义。

需要留意的几点

该消息源自社区用户的第三方测评,而非官方发布,因此有以下不确定性:

  • 原帖脚注注明 Kimi K3 是「即将开源的模型」,开放权重尚未正式释出
  • 「Opus 4.8」与「5.6 Terra 级别」的具体定义与对比基准在原帖中并未展开
  • 结果的可复现性、测试方法与样本规模有待更多独立验证

总体而言,这是一条来自开发者社区的早期信号:开源权重模型在英文编辑类基准上首次具备与闭源旗舰掰手腕的能力,但相关结论仍需更多一手材料佐证。

信源