桃子桃子快讯
返回首页
行业动态

Yutori 分享 Web Agent 推理优化:2–5 倍成本优势

Together AI 转发 RaiseSummit 演讲,Yutori 介绍如何通过缓存、投机解码与 Qwen 后训练…

2026.08.21 · 周五3 分钟阅读

Together AI 近日在 X 平台转发了上月 RaiseSummit 大会的一段演讲片段,嘉宾为 Yutori AI 联合创始人兼 CEO abhshkdz,主题是 Web Agent 的推理经济学与工程优化。Yutori 的核心产品 Navigator 是一款面向浏览器自动化任务的智能体,其部署成本据称比闭源模型低 2 至 5 倍,速度也更快。

Web Agent 的推理成本结构

演讲开篇点明了 Web Agent 与普通对话产品的本质差异:Agent 的每一次页面交互(点击、填写、导航、抓取)都是一次独立的推理调用。简单的单字段抽取或表单填写任务需要 10 至 20 次调用,而跨站点的多步工作流动辄数百次调用。因此,Agent 的单位经济性完全取决于「每次调用的成本 × 调用次数」这一乘积,任何能压低单次推理开销或减少总调用数的优化都会被显著放大。

Yutori 的三项关键优化

Yutori 在演讲中披露了三项使其成本大幅下降的核心技术:

  • 高前缀缓存命中率:Navigator 在实际运行中达到了约 80% 的 prefix cache hit rate。Web Agent 的工作流存在大量重复的 system prompt 与工具描述,缓存命中意味着大量 token 不必重新计算,直接复用 KV cache,从而摊薄每次调用的算力开销。

  • 投机解码(Speculative Decoding):Yutori 在较小的「草稿模型」上进行多步预测,再由主模型一次性校验。草稿模型选用的是轻量化版本,部署成本低,能在不明显牺牲质量的前提下显著降低推理时延与算力消耗。

  • Qwen 模型的后训练:Yutori 并非直接调用通用 Qwen,而是在其上做了 SFT(监督微调)与 RL(强化学习)的后训练,使其更适配网页交互的指令格式与任务分布。这种「开源基座 + 垂直后训练」的路线,使其在保留 Qwen 能力的同时获得了比通用闭源模型更高的任务完成效率。

运行基础设施:Together AI 的作用

演讲最后强调,Yutori 全量跑在 Together AI 之上。Together 提供的可定制推理端点(customizable endpoints)与自动扩缩容(auto-scaling)能力,使 Yutori 能够在几分钟内部署一个新模型变体并做 A/B 测试,快速迭代后训练策略,而无需自行维护 GPU 集群。这一基础设施层面的灵活性,被视为 Yutori 能够在小型团队规模下保持高频迭代的重要原因。

整体来看,该演讲展示的是一条「开源基座 + 垂直后训练 + 推理工程优化 + 弹性云端推理」的典型路径,对正在构建 Agent 类产品的团队具有参考意义。但需注意,2–5 倍的成本优势是 Yutori 自述数据,目前尚无独立第三方基准验证。

信源