桃子桃子快讯
返回首页
产品功能

科大讯飞推出星火 Token Factory,主打企业级大模型路由与治理

科大讯飞发布星火 Token Factory,提供统一接入、智能路由、推理优化、安全治理与成本归因等能力,面向企业大模型…

2026.07.23 · 周四4 分钟阅读

科大讯飞于 7 月 19 日正式发布星火 Token Factory,定位为企业级 AI 模型智能路由平台。该平台作为企业应用与大模型之间的统一中间层,主打模型统一接入、智能路由调度、Token 成本优化与安全合规治理四项核心能力,覆盖「接入—治理—观测—运营」完整闭环,目标是为多模型并行的企业场景提供可管、可控、可追溯的大模型服务入口。

背景:企业大模型应用进入多模型协同阶段

随着大模型从单点试点走向多业务、多场景、多团队协同应用阶段,企业普遍需要同时接入多个模型服务,支撑代码助手、智能客服、知识问答、内容生成、文档处理等不同业务。但在调用规模增长过程中,资源利用效率低、Token 成本攀升、稳定性与安全治理压力加大等问题也随之出现。讯飞将这一阶段的企业需求归纳为「从模型能力建设迈向 AI 基础设施建设」,关注的重点从模型本身能力转向统一管理、成本控制与持续优化。

核心能力一:基于任务复杂度的智能路由

星火 Token Factory 构建了多维度特征判定的任务分级机制,综合考虑 Prompt 长度、规则预置、自定义规则、对话轮次、session 亲和等因素,将请求划分为 L1 至 L3 三级,并依据质量、成本、延迟、可用性、安全等级五个因子匹配模型资源。简单任务路由到更具性价比的模型,复杂任务优先匹配高能力模型。整个决策的平均延迟控制在 100 毫秒以内,意在降低大尺寸模型的调用压力并释放成本优化空间。

核心能力二:面向昇腾硬件的推理优化

针对国产化私有部署场景,星火 Token Factory 围绕昇腾硬件对主流开源大模型做了端到端工程优化,覆盖显存、计算与通信、缓存与调度、解码四个层面:

  • 显存侧:通过模型压缩与精度优化降低显存占用;
  • 计算与通信侧:融合算子并对多卡通信做调度重排,实现计算与通信的重叠;
  • 缓存与调度侧:引入分布式 KV Cache 管理与 Cache-Aware 缓存路由,提升长上下文与高并发命中率;
  • 解码侧:引入并行解码加速机制,缩短生成密集场景的端到端延迟。

官方给出的对比数据为:在相同硬件条件下,针对主流开源模型的基准测试,星火 Token Factory 相较开源 vLLM-Ascend 框架推理效率提升约 5 倍,首 Token 延迟降低 30%–40%。

核心能力三:安全治理与成本归因

在安全层面,平台引入「三权分立」机制,将管理、操作、审计三者分离并互相制约,配合混合授权降低越权与数据泄露风险;全链路审计日志覆盖数据访问、权限变更、模型调用等六大类操作,满足等保要求;同时对个人隐私与经营类敏感信息进行分级路由,确保敏感数据不出域。

成本侧,平台提供端到端全链路日志审计,记录路由决策、Token 消耗与调用过程,并配合预算管理、ROI 分析与可视化报表,将每次调用的运行状态与资源消耗可视化,定位问题并为后续资源规划提供数据支撑。

落点:企业 AI 从单点探索走向规模化运营

科大讯飞将星火 Token Factory 视为其在企业 AI 基础设施方向的能力补充,强调该平台面向长期可持续运营而非单纯的模型调用。从单点探索到规模化运营,是当前国内大模型 ToB 落地普遍讨论的命题;星火 Token Factory 以「统一接入 + 智能路由 + 治理观测」的组合切入,为企业提供一套中立的模型调度与管理底座,但其在多模型生态中的实际适配范围与客户落地效果,仍有待后续披露进一步验证。

信源