桃子桃子快讯
返回首页
行业动态

华盛顿邮报月处理 17.9 亿输入 token,托管在 Together AI

华盛顿邮报每月通过 Together AI 处理约 17.9 亿输入 token,生产环境使用 Llama、Mistra…

2026.07.25 · 周六2 分钟阅读

Together AI 在 X 平台披露,华盛顿邮报(The Washington Post)每月通过其推理服务处理约 17.9 亿(1.79B)输入 token,生产环境中运行的是 Llama、Mistral 等开源权重模型。该案例展示了主流媒体在可控成本前提下,将生成式 AI 推理工作负载托管给独立推理云厂商的路径。

用量与部署规模

  • 月输入 token 规模:约 1.79B(约 17.9 亿)
  • 模型选择:Llama、Mistral 等开源模型
  • 部署形式:生产环境(in production)
  • 服务提供方:Together AI

Together AI 在帖子中强调,华盛顿邮报获得了「predictable costs」(可预测的成本)以及对整个模型栈「full control」(完全控制权),这是其选择开源模型加独立推理平台组合的关键原因。

这一案例的行业含义

对希望在自有内容生产链路中集成大模型的传统媒体而言,使用开源模型配合第三方推理平台是一种折中方案:既绕开了闭源 API 的数据出境与单价波动风险,又无需自建 GPU 集群。17.9 亿 token/月的体量说明,开源模型推理已能承载真实的新闻业务流量,而非停留在概念验证阶段。

信息局限

Together AI 发布的仅为客户案例摘要,未披露以下细节:

  • 输出 token 量及总 token 规模
  • 具体使用的模型版本(如 Llama 3、Mistral Large 等)
  • 业务场景(内容生成、检索增强、翻译等)
  • 成本数据与延迟指标

上述信息需要后续通过华盛顿邮报官方渠道或 Together AI 更详细的技术博客补充。

信源