桃子桃子快讯
返回首页
行业动态

基础设施比下一款 LLM 更重要

Ito 结合每周 1000 亿 token 的生产经验指出,模型能力差距正快速收敛,企业应在路由、缓存与 harness…

2026.08.22 · 周六3 分钟阅读

随着 OpenAI、Anthropic 等厂商的模型能力趋于收敛,单纯追求「用上最新模型」的边际收益正在快速下降。AI 代码审查公司 Ito 近日发文,结合自身每周消耗约 1000 亿 token 的生产经验,主张基础设施正在取代模型本身,成为 AI 应用差异化的关键。

模型差距正在收敛

Ito 观察到,过去 OpenAI 与 Anthropic 之间的「跳蛙式」领先循环已基本结束,开源权重模型如 Kimi 也已具备竞争力。各家厂商的发布口径也在变化:Anthropic 在 Opus 4.8 发布稿中直言「相比上一代只是小幅但切实的改进」,OpenAI 在 GPT-5.6 发布中则把重点放在「每美元更强性能」上,强调负载均衡、内核重写带来约 20% 的服务成本下降,以及推测解码带来的 15% 生成加速。Artificial Analysis 的智能指数显示,Luna 与 Terra 之间仅相差几分,Opus 与 Fable 也呈现类似趋势——不同模型正在以质量趋同、以成本和速度分层。

厂商基准 ≠ 生产基准

厂商惯用通用基准来证明自家模型的优势,但这些数字在生产环境中未必能复现。Ito 在单一固定编码任务上测试了 14 款模型、每款跑 6 次,结果颇有反差:

  • KAT-Coder-Pro V2.5 输出速度排第三(113 tokens/s),但因消耗 5536 tokens,最终排名第十;GPT-5.5 仅用 1777 tokens 即可完成。
  • Kimi K3 的实际耗时是 Luna 的 11.5 倍。
  • 同一产品线中,Luna 耗时 15 秒、成本 0.012 美元;Terra 耗时 28 秒、成本 0.042 美元;Sol 耗时 59 秒、成本 0.079 美元——付 5 倍单价换来的是 3.8 倍的等待时间。
  • Kimi K2.7 Code 单 token 价格高于 KAT-Coder,但任务总成本反而低 37%;GLM-5.2 单 token 价格是 MiniMax M3 的 2.2 倍,任务总成本却几乎一致。
  • DeepSeek V4 Pro 单任务成本仅 0.0017 美元,比 Claude Fable 5 便宜约 73 倍。

DoorDash 在其代码评审 Agent 的工程博客中也得出类似结论:最便宜的模型不一定是总成本最低的方案,复杂结构化输出场景下弱模型反复重试反而更费钱。

基础设施成为新的护城河

Ito 认为,在模型能力趋同的背景下,价值链正在上移,企业需要回答四个工程问题:

  • 如何在工作流中路由不同模型?
  • 哪些中间结果值得缓存?
  • 怎样持续评估产出质量?
  • 当新模型出现时,改造调用外壳(harness)需要多久?

能稳定回答这些问题的团队,即便使用相同的模型集合,也能在质量与成本上拉开差距。Ito 的结论是:保持模型无关的架构、避免把 harness 绑死在某一型号上,才是当下最划算的工程投入。

需要注意的是,文章系 Ito 自家博客发布,文中实验数据来自该公司单一编码任务,且部分被引用的模型发布(如 2026 年 5 月的 Opus 4.8、2026 年 7 月的 GPT-5.6)涉及未来时间点,读者在参考其结论时,宜结合自身业务场景再做判断。

信源