无问芯穹集齐四家国产头部基模,Agentic Infra战略全貌浮出水面
WAIC 2026期间,MiniMax与阶跃星辰先后亮相无问芯穹论坛,叠加此前的智谱、Kimi合作,四家国产头部基模公司…
无问芯穹在 2026 世界人工智能大会(WAIC)期间迎来两家头部国产基模公司同时亮相——MiniMax签署战略合作,阶跃星辰发布主旨演讲。更早之前,智谱张鹏与Moonshot(Kimi)杨植麟已在今年中关村论坛上与无问芯穹联合创始人兼CEO同台讨论,并被现场点名该公司已为Kimi、智谱提供服务。四家国产头部基模公司先后与同一家AI Infra公司达成深度合作,这一格局在国内大模型产业链中并不多见。
供需剪刀差里的位置
需求侧的爆发是合作达成的根本驱动力。2026年起,推理算力消耗开始反超训练,成为AI算力的主战场——推理成本两年间下降约280倍,但企业AI总支出并未随之下降。中国日均Token调用量已突破140万亿,较一年前增长约四成,呈指数级攀升。供给端却仍是线性扩产节奏:多建机房、多添显卡的传统路径在三五年内难以填平缺口。无问芯穹切入的,正是这一供需之间的口子。
三重押注:效果、成本、稳定性
无问芯穹认为,MaaS生意的核心门槛集中于三件事。
效果方面,模型部署存在隐蔽的质量滑坡——同一请求看似正常回复,输出精度可能已悄然下降三成,常规监控难以捕捉。公司在模型上架前设置准入测试标准,从工具调用一致性到推理模式精度对齐逐项核验,确保通过无问芯穹部署与原厂API体验几乎一致。
成本方面,无问芯穹在WAIC官宣自研的「跨集群异构PD分离」架构。该架构将推理中的Prefill与Decode两个负载特性不同的阶段拆分到不同芯片上运行;为解决跨机房以太网传输KV Cache时带宽低、延迟高的问题,公司将Radix Cache技术迁移到跨集群架构以压缩传输数据量,并首创PDD三级链路(Prefill、RelayDecode、MainDecode),让RelayDecode先顶住高延迟请求。实测显示,TTFT降低51.5%,单Token成本降低37.5%。
稳定性方面,公司发布「智算集群运维智能体系统」,7×24小时全天候值守,使运维人效提升5倍以上、关键故障处理效率提升6倍。
「前店后厂一中心」系统布局
围绕「AI生产力 = 智能资源规模 × Token转化效率 × AI生产力转化效率」这一公式,无问芯穹构建了完整的Agentic Infra战略:
- 一中心(算力集散中心):已部署37000P算力,覆盖16种主流国产芯片,实现跨域强化学习训练连续一周0中断运行,未来目标支撑十万卡级以上规模。
- 后厂(Token工厂):Agentic MaaS平台截至7月日均Token调用量较去年12月增长40倍;与上海移动联合打造「天问」模型服务门户,与观猹合作推出面向开发者的TokenDance,对标OpenRouter。
- 前店(AI生产力商店):行业解决方案已覆盖文娱游戏、医疗健康、法律终端、能源电力等领域,合作案例包括VAST的3D游戏方案、上海瑞金医院医疗大模型、律所AI合伙人产品,以及与南方电网合作的智算中心能耗预测。
此外,公司搭建了由平台管家、运维、算子生成三类智能体组成的「基础设施智能体蜂群」。平台管家智能体可独立解决80%日常问题;在GLM 5.2模型实测中,NVIDIA旗舰卡端到端性能提升7.3%,AMD旗舰卡提升39%。
对标海外,押注异构生态
海外对标对象是Baseten、Together AI、Fireworks AI——这三家公司估值均在130亿至150亿美元区间,但底层均基于英伟达单一生态。无问芯穹面对的是更为碎片化的国产芯片生态,因此把多元异构与更完整的架构布局作为差异化护城河。「懂算力、懂模型结构、懂训推优化、懂应用场景」四件事能否同时做到位,将决定它在这条赛道上的最终位置。
