桃子桃子快讯
返回首页
行业动态

Kimi K3 在 Harvey 法律基准上接近 Claude 两倍得分

Together AI 在 X 发文称 Kimi K3 在 Harvey 自主法律任务基准上得分接近 Claude 变体…

2026.08.07 · 周五2 分钟阅读

AI 云服务平台 Together AI 在 X 上发文称,Moonshot(月之暗面)的 Kimi K3 模型在 Harvey LAB-AA 的高难度自主法律任务基准上,得分接近 Claude Fable 5 的两倍。这一结果若属实,将标志中国大模型在垂直法律场景中对主流美国厂商形成显著优势,但目前信息极为有限。

基准与对比对象

Harvey LAB-AA 是法律科技公司 Harvey 推出的自主智能体评测基准,聚焦于需要多步推理、工具调用与文档检索的复杂法律任务。推文中提到的「Claude Fable 5」疑似为 Claude 系列变体或针对法律场景的定制版本,但 Anthropic 官方并未确认此命名的产品,也不排除是笔误或评测方的内部代号。

  • 基准名称:Harvey LAB-AA
  • 任务类型:高难度自主法律任务(hard autonomous legal tasks)
  • 对比对象:Claude Fable 5(命名存疑)

Kimi K3 的背景

Kimi 是 Moonshot AI 旗下的对话式大模型产品线,长期以长上下文处理能力见长。K3 被外界视为该系列的下一代模型,但截至目前 Moonshot 尚未发布关于 K3 的官方技术报告、模型卡或完整 benchmark 数据。此次成绩由第三方平台而非 Moonshot 官方渠道披露,信息透明度有限。

信息局限与待验证点

目前可获取的内容仅来自 Together AI 的一条简短推文,缺少以下关键细节:

  • Kimi K3 的具体得分、置信区间与样本量
  • 「Claude Fable 5」的真实身份与对应得分
  • 测试环境、prompt 设计、是否启用工具调用等评测方法
  • 是否经过 prompt 工程或后训练增强

在没有官方 benchmark 报告或论文支撑之前,这一对比结果应视为单一来源的初步信号,而非定论。法律 AI 评测受数据集构成、任务定义与评估流程影响显著,跨厂商对比需要更透明的方法论才能形成可靠结论。建议关注 Harvey、Moonshot 或 Anthropic 后续是否发布更完整的数据披露。

信源