桃子桃子快讯
返回首页
行业动态

Together AI 声称在 Kimi K3 多项推理基准中领先

Together AI 公布其对 Moonshot Kimi K3 端点的基准测试结果,称在 OCRBench、MMMU…

2026.08.06 · 周四2 分钟阅读

AI 推理服务商 Together AI 近日在 X 平台发布消息,称其对月之暗面(Moonshot)旗下 Kimi K3 端点在多家主流推理服务商中的表现进行了基准对比。结果显示,Together AI 在四项基准测试中的三项上取得第一或并列第一的位置。Together AI 同时强调,开源模型 Kimi K3 的质量已达到「前沿级」(frontier-class),因此推理服务的性能变得尤为关键。

Together AI 公布的核心结果

Together AI 在推文中列出了其取得领先的三项基准:

  • OCRBench
  • MMMU Pro Vision
  • DeepSWE

四项基准中有一项未取得第一,推文未指明具体是哪一项,也未给出各服务商的具体得分或差距。

背景:开源模型走向「前沿级」

Together AI 在声明中特别肯定了 Kimi K3 的能力水平,将其描述为「genuinely good」「frontier-class good」,意即不再只是开源阵营的补充,而是具备与闭源前沿模型竞争的能力。这一表述与近期业内对开源权重模型快速逼近闭源前沿水平的判断一致。

推理服务商竞争白热化

随着 Kimi K3、DeepSeek、Qwen 等开源权重模型在能力上逼近闭源前沿,模型推理(inference)环节的差异——包括吞吐、延迟、价格、上下文长度支持等——正成为服务商争夺用户的关键战场。Together AI 此次主动公开基准,意在通过第三方(Moonshot)的参与为其推理服务质量背书。

信息局限

需要指出的是,本次基准由 Together AI 自身公布并经 Moonshot 参与验证,但推文中并未公开:

  • 具体得分与对比表
  • 测试硬件配置与推理框架
  • 评估方法论细节
  • 未取得领先的那项基准的名称

上述信息的缺失使得该结论的可重复性与横向比较性受限,读者在参考时应注意区分厂商自宣与独立评测的边界。

信源