桃子桃子快讯
返回首页
行业动态

Kimi K3 传在法律基准上接近 Claude 两倍得分

X 平台一则帖文称 Kimi K3 在 Harvey LAB-AA 法律任务基准上得分接近 Claude(Fable 5…

2026.08.06 · 周四2 分钟阅读

Moonshot AI 旗下的 Kimi 系列被传出新版本在法律领域基准测试中得分大幅领先 Claude。据一条发布在 X 平台的帖文称,「Kimi K3」在 Harvey LAB-AA 的「困难自主法律任务」评估中得分接近「Claude Fable 5」的两倍。

消息来源

该帖文标注来源为「Together AI · X」,正文仅一行陈述加一条外链,未附带具体分数、评测配置、模型版本号或测试方法说明。原始推文中出现的「Kimi K3」与「Claude Fable 5」在公开资料中均无确切对应:目前 Moonshot 已公开的最新版本为 Kimi K2,Anthropic 近期对外发布的版本以 Claude Sonnet 4.5、Haiku 4.5 等为主,「Fable 5」并非已知的官方命名。

关于 Harvey LAB-AA

Harvey LAB-AA 是法律科技公司 Harvey 推出的一组评估基准,聚焦「困难自主法律任务」,考察大模型在复杂法律推理、长文档分析与多步任务执行上的能力。该基准在法律 AI 圈内被视为参考性较强的评测之一,但样本规模与任务覆盖面相对窄。

信息缺口

仅凭这一条推文,目前尚无法独立验证以下关键要素:

  • 具体得分数值与「接近两倍」的实际倍数
  • 评测使用的 prompt 模板、上下文长度与采样设置
  • 参与对比的模型完整版本号与权重日期
  • 测试是通过 API 调用还是本地部署完成
  • 是否针对法律领域做过专门微调或提示工程

结论

在 Moonshot 或 Anthropic 发布官方博客、技术报告,或有独立第三方复现结果之前,这条成绩不宜作为模型综合能力的直接对比依据。读者可关注后续是否有更详细的评测披露,再做判断。

信源