行业动态
华盛顿邮报月处理 17.9 亿输入 token,托管在 Together AI
华盛顿邮报每月通过 Together AI 处理约 17.9 亿输入 token,生产环境使用 Llama、Mistra…
2026.07.25 · 周六约 2 分钟阅读
Together AI 在 X 平台披露,华盛顿邮报(The Washington Post)每月通过其推理服务处理约 17.9 亿(1.79B)输入 token,生产环境中运行的是 Llama、Mistral 等开源权重模型。该案例展示了主流媒体在可控成本前提下,将生成式 AI 推理工作负载托管给独立推理云厂商的路径。
用量与部署规模
- 月输入 token 规模:约 1.79B(约 17.9 亿)
- 模型选择:Llama、Mistral 等开源模型
- 部署形式:生产环境(in production)
- 服务提供方:Together AI
Together AI 在帖子中强调,华盛顿邮报获得了「predictable costs」(可预测的成本)以及对整个模型栈「full control」(完全控制权),这是其选择开源模型加独立推理平台组合的关键原因。
这一案例的行业含义
对希望在自有内容生产链路中集成大模型的传统媒体而言,使用开源模型配合第三方推理平台是一种折中方案:既绕开了闭源 API 的数据出境与单价波动风险,又无需自建 GPU 集群。17.9 亿 token/月的体量说明,开源模型推理已能承载真实的新闻业务流量,而非停留在概念验证阶段。
信息局限
Together AI 发布的仅为客户案例摘要,未披露以下细节:
- 输出 token 量及总 token 规模
- 具体使用的模型版本(如 Llama 3、Mistral Large 等)
- 业务场景(内容生成、检索增强、翻译等)
- 成本数据与延迟指标
上述信息需要后续通过华盛顿邮报官方渠道或 Together AI 更详细的技术博客补充。
