阿里平头哥亮出真武V900,AI软件栈T-Head SAIL加速开源
云栖大会上阿里发布真武V900芯片,并进一步开源AI软件栈T-Head SAIL,已服务650余家客户,小鹏、蚂蚁、小红…
2026年9月22日云栖大会上,阿里巴巴集团CEO吴泳铭介绍新一代真武V900 AI芯片,称其「是目前中国算力性能最强的AI芯片,性能达到M890的3倍」。次日,平头哥进一步公布围绕真武打造的AI软件栈T-Head SAIL的开源进展,将适配框架、加速库、工具链和通信库等更多组件向开发者开放。这意味着大厂造芯正在从单纯交付硬件,走向更广泛的开放共建阶段。
从硬实力到软实力:SAIL补齐的是软件生态
平头哥将AI芯片比作「发动机」,软件栈比作「变速箱+传动系统+驾驶系统」。SAIL是连接PyTorch等上层AI框架与真武硬件的中间层,承担模型迁移、编译执行、计算加速和开发调试等职责,类似英伟达CUDA在GPU生态中的位置。
此次开源进展包括:
- 框架适配:PyTorch-for-sail
- 源码迁移工具:sailify
- 算子开发工具:Triton-for-sail
- 计算加速项目:DeepGEMM-for-sail、FlashAttention-for-sail
此外,TensorFlow、JAX适配版本、自研推理引擎,以及PCCL、DeepEP-for-sail等通信组件和调试监控工具也在持续推进开源。平头哥的目标是让开发者能够查看、修改代码,根据自身业务负载继续优化,把对模型的理解直接转化为硬件执行效率。
已有650余家客户入场,小鹏、蚂蚁、小红书开始自己动手
真武AI芯片已服务20多个行业的650多家客户。开源落地后,三家头部企业的实践颇具代表性:
- 小鹏汽车:借助SAIL将原运行在GPU平台上的业务模型迁至真武云端集群,开展智能驾驶模型训练,并利用性能分析工具定位训练瓶颈。SAIL支持C++、Triton、TileLang等开发方式,目标是减少团队重新学习的成本。
- 蚂蚁集团:推理服务团队已在真武810E和M890上完成主要前沿模型的推理适配,下一步工作集中在量化、推理阶段分离、专家并行负载均衡、稀疏注意力接入。
- 小红书:基于SAIL开源代码,面向真武架构开发了模型迁移与算子优化Agent,用自动化方式加速生成式推荐模型的部署上线,把业务经验写进工具。
SAIL开源后,平头哥已收到阿里内部和外部客户的代码贡献,反馈包括希望贡献自有项目、获取更多硬件架构信息以便开发定制算子,以及加快新模型、新框架的支持节奏。
模型资源与适配节奏:39个量化模型、累计下载超34.8万次
开发者关心的另一个问题,是新模型发布的当天能否在自家算力平台上跑起来。截至2026年9月,平头哥在ModelScope上已提供39个量化模型,覆盖Qwen、DeepSeek、Kimi等系列,累计下载超过34.8万次。这些已经完成适配的模型可减少用户自行准备的工作,让部署和测试更早开始。
更深层的逻辑是:芯片厂商基于主流框架做适配时,往往需要修改一部分代码。若长期维护独立版本,上游每次更新都要重新同步、测试;将适配和优化提交回PyTorch、vLLM、Triton等上游社区,才能让真武支持随主流软件一起演进,也让客户更快用上新技术。
战略背景:3800亿元投入下的芯片+模型+云协同
开放的时间节点并非偶然。平头哥已走过含光800(2019)、倚天710(2021)、真武系列等节点,真武M890完成两代完整芯片交付,软件成熟度与客户二次开发需求共同促成了这一轮开放。
今年云栖大会上,吴泳铭明确提出阿里将长期投入AI模型、AI芯片和AI云。早在2025年2月,阿里已宣布三年内至少投入3800亿元建设云和AI基础设施,并表示将进一步增加投入。平头哥正与千问团队合作,探索让模型生成高性能算子,但模型自动生成仍需理解底层架构。SAIL的进一步开放,是让小红书、小鹏这样的外部团队也能参与连接模型与硬件的软件开发。
芯片已经进入真实业务,SAIL的名字取自「Seed of AI Library」。当一行行经过验证的代码被交到开发者手中,大厂造芯的下一程,考验的是生态能否真正长出来。
