工具
Together AI 上线 Inkling-Small 高吞吐推理服务
Together AI 在其平台推出 Inkling-Small 模型的高吞吐生产级部署,面向多模态、编程与智能体场景。
2026.07.31 · 周五约 2 分钟阅读
AI 推理云平台 Together AI 近日宣布,为开发者提供在其基础设施上运行 Inkling-Small 模型的高吞吐生产级部署路径。该服务基于 NVIDIA 加速计算基础设施,覆盖多模态处理、代码生成与智能体(agentic)三类典型工作负载。
部署与适用场景
根据 Together AI 在 X 平台发布的消息,Inkling-Small 的部署面向生产环境,强调高吞吐量与稳定性。结合官方描述,该服务主要面向以下几类应用:
- 多模态任务:处理跨文本、图像等多种输入类型的推理请求。
- 编程辅助:支撑代码生成、补全等开发者场景。
- 智能体工作流:为需要多步推理、工具调用的 AI agent 提供推理后端。
关于 Inkling-Small
截至目前,Together AI 在公开消息中并未披露 Inkling-Small 的参数规模、训练数据、上下文长度、基准测试成绩或开源协议等关键信息。该模型是否为 Together AI 自研、是否开放权重、与其他主流小尺寸模型的相对性能如何,尚缺乏一手资料支撑。
基础设施与生态定位
Together AI 长期专注于大模型推理云服务,主打 NVIDIA GPU 上的高吞吐、低成本部署。本次将 Inkling-Small 接入生产路径,与其在 Llama、Mixtral 等开源模型上的既有部署服务定位一致,意在为开发者提供一键式的模型托管方案,而非自下而上训练新模型。
由于原始消息仅为一条简短的推广推文,未附带技术白皮书、价格或性能数据,Inkling-Small 的实际能力与商业可用性仍有待官方进一步披露或第三方评测验证。
