工具
Together AI 无服务器推理上线 Qwen3 系列模型
Together AI 宣布在其 Serverless Inference 平台上线 Qwen3 系列模型,面向编程与智…
2026.08.13 · 周四约 2 分钟阅读
AI 推理平台 Together AI 在其官方 X 账号宣布,已在其 Serverless Inference 平台上推出针对 Qwen3 系列模型的托管式无服务器推理能力,重点面向编程(coding)与智能体(agentic)类工作负载。开发者可通过该服务直接调用 Qwen3 相关模型,无需自行部署和管理底层推理基础设施。
什么是 Together Serverless Inference
Together Serverless Inference 是 Together AI 提供的一项托管推理服务,开发者按需调用即可获得模型推理能力,平台负责底层算力调度、扩缩容与高吞吐优化。此次新增的 Qwen3 系列模型支持,意味着开发者可以在该平台上以更低的运维成本运行 Qwen3 模型,特别是处理代码生成、Agent 工作流等对吞吐量与响应速度要求较高的场景。
主要面向的工作负载
根据官方说明,本次上线的服务重点面向以下两类场景:
- 编程工作负载:覆盖代码生成、补全、调试等典型开发场景,开发者可直接通过 API 接入。
- 智能体(Agentic)工作负载:支持多轮工具调用、复杂任务分解等 Agent 类应用对推理的需求。
注意事项与信息缺口
需要指出的是,Together AI 此次公布的原始消息为单条 X 帖文,信息密度有限:
- 帖文未给出具体的模型规格(如参数规模、是否包含 MoE 结构、上下文长度等),原始文本中的模型标识为「Qwen3.8-2.4T-A95B」,这一名称与目前公开可查的 Qwen3 命名体系并不一致,可能存在转写或识别误差,读者应以 Together AI 官方文档为准。
- 未披露定价策略、推理性能基准(如 tokens/s、TTFT 等)以及具体的 SLA 保障。
- 与同类无服务器推理服务(如 Fireworks、Anyscale Endpoints 等)相比的差异化定位尚未明确。
如需进一步了解可用模型列表、调用方式及计费细节,建议前往 Together AI 官方文档页或注册 Serverless Inference 后台查看。
