行业动态
Together AI:开源模型一年内 token 占比从 10% 升至 30%
Together AI 数据显示,开源模型 token 占比一年从 10% 升至 30%,成本优势正成为规模化采用的关键…
2026.07.27 · 周一约 3 分钟阅读
AI 基础设施平台 Together AI 在社交平台 X 上公布了一组行业数据:开源模型在大模型推理流量中的 token 占比,在一年内从约 10% 上升到 30%。该公司据此认为,关于"开源权重是否值得投入"的争论已经有了来自实际流量的回答——开源加模块化的组合在成本上胜出,而成本正是解锁规模化应用的前提。
数据要点
Together AI 的核心观察可以归纳为一个数字和一个判断:
- 数字:开源模型在 token 流量中的占比从约 10% 增长至约 30%,时间跨度为一年。
- 判断:这一增长来自成本优势,而非单纯的能力追赶。Together AI 认为,把"开源权重 + 模块化部署"组合在一起,能够在推理成本上压过纯闭源 API 模式。
Together AI 在推文中附带了链接,指向其更完整的分析与图表,但原始推文本身并未公布样本范围、统计口径与对比基准等细节。
行业背景
开源与闭源的路线之争过去两年持续升温。一方面,Llama、Mistral、Qwen、DeepSeek 等系列不断刷新开源模型的性能上限;另一方面,OpenAI、Anthropic、Google 等厂商依然主导着最前沿的闭源 API 市场。Together AI 的这组数据为"开源阵营正在快速吃掉推理流量"这一直觉提供了量化支撑——一年内 token 占比翻三倍,意味着大量原本可能调用闭源 API 的工作负载,已经转向开源权重自托管或开源推理服务。
成本为何成为胜负手
Together AI 的论点核心是"成本即规模":
- 闭源 API 按 token 计费,单价较高,长上下文、多轮 agent、高频调用等场景下成本压力明显。
- 开源权重一旦部署,推理的边际成本主要由算力和能耗决定,配合 vLLM、TensorRT-LLM、SGLang 等推理框架以及量化、投机解码等工程手段,单位 token 成本可被持续压低。
- 模块化部署还允许企业根据延迟、吞吐、合规需求灵活组合不同大小的模型,进一步摊薄成本。
仍待回答的问题
不过,单一来源的占比数据并不能完整回答开源路线的全部疑问:
- 样本边界不清晰:Together AI 并未说明这 30% 是其自家平台流量、合作伙伴流量,还是更广义的行业估算。
- 能力天花板未触及:占比上升说明部署成本可承受,并不等同于在最难的任务上取代了闭源旗舰模型。
- 生态可持续性:开源模型的后续维护、安全审计、微调支持等长期成本,仍是采用方需要权衡的变量。
Together AI 的推文更像是一份"中期趋势快报"——它给出了方向,但完整的论证仍依赖其后续发布的更详尽报告。
