推理芯片成大模型价格战新焦点,自研能否破局?
DeepSeek 等厂商持续降价,推理芯片成本日益凸显,多家大厂开始自研推理芯片以降低成本。
随着大模型商业化落地与 Token 调用规模扩大,推理芯片正在取代训练芯片,成为 AI 大模型厂商最主要的成本支出。DeepSeek 创始人梁文峰近日在投资会上直言「芯片价格太贵,无法满足 DeepSeek 对大模型低成本的需求」,这一表态折射出当前国内主打低价格的大模型厂商共同面临的算力成本压力。
DeepSeek 带动新一轮行业降价
DeepSeek 在 2026 年延续了激进的定价策略。5 月 23 日,DeepSeek 将 V4-Pro 模型的折扣优惠转为永久降价,专业版 API 调用价格定为 2.5 折,并推出类似电价的峰谷定价机制;5 月 28 日,小米旗下 MiMo-V2.5 全系列 API 接口永久下调资费,部分细分场景降价幅度接近 99%,不再区分上下文窗口长度,统一按低价计费;6 月底,腾讯云平台上线的 DeepSeek-V4 全系列模型同步下调调用价格,最高降幅达 97.5%,第三方入驻模型 MiniMax-M3 的推理输入、推理输出、缓存命中三项费用也均下降 50%。
降价的效果立竿见影。OpenRouter 数据显示,调价后 DeepSeek-V4-Flash 模型登顶全球调用榜,而此前 DeepSeek 旗下 V3.2/R1 等模型排名最高也只到第三位。专业版百万 Tokens 价格降至约 0.025 元,仅为同类产品的 5.8% 左右。
DeepSeek 能维持低价的原因主要有两点:
- 算法与工程优化大幅压低算力消耗,例如 V4 系列处理百万级 Token 长上下文时算力消耗仅为上代的 27%,缓存与真题训练成本各降约 10%;
- 摆脱对英伟达的依赖,采购华为昇腾等国产算力芯片,降低硬件采购成本。
推理芯片成为新的成本瓶颈
降价带来的优势正在逼近天花板。推理芯片之所以成为价格战下半场的关键变量,原因在于两个方面。
第一,采购数量与采购成本大幅上升。大模型厂商过去的算力支出以训练为主,但 AI 商业化逐步落地后,推理芯片成为采购主力。阿里云在「2026 年算力倍增计划」中,AI 资本开支里推理芯片采购预算占总预算的 60%;Meta 计划在 2026 年底建成 60 万张 GPU 等效算力的推理集群,占其 AI 总预算的 55%。联想集团董事长杨元庆在 5 月业绩发布会上表示:「过去约 70%—80% 的 AI 算力用于训练、20%—30% 用于推理,未来这一趋势将倒过来,推理算力将占到 70% 以上。」
第二,推理芯片的全生命周期成本极高。推理芯片需要直接响应用户调用请求,成本会随着问答量持续累积。有数据显示,在生产环境中推理芯片投入占大模型生命周期计算成本的 80% 至 90%。短期采购量大叠加长期费用占比高,使推理芯片成为 AI 商业化时代最重的成本项。
自研推理芯片并非坦途
面对成本压力,多家大厂已把自研推理芯片提上日程。DeepSeek 在完成首轮 510 亿元外部融资后,将自研 AI 推理芯片列为重要资金用途之一;OpenAI 于今年 6 月发布了与博通联合开发的定制推理芯片 Jalapeño,目标是将推理成本降低约 50%;Anthropic 则从 OpenAI 挖来其自研芯片团队早期核心成员 Clive Chan,负责整体推理芯片研发。
然而,自研之路并不轻松,主要面临三重挑战:
- 研发难度高:AI 大模型企业擅长算法与软件,要跨界做硬件需要在人员和技术上从零积累;
- 出厂即可能落后:华为昇腾、寒武纪、英伟达等专业芯片厂商面向全行业迭代,节奏快于仅为自身需求定制的自研芯片;
- 缺乏生态支撑:英伟达的核心壁垒不只是算力,更是超过 400 万开发者的 CUDA 生态;而 DeepSeek、智谱等自研芯片只能自用,难以依靠规模摊薄研发成本。
综合来看,自研推理芯片的真正难点不在研发本身,而在算法迭代、芯片流片、产能排期与用户生态四方面的协同打通。只有在这些环节都跑通之后,自研推理芯片才能真正压低每百万 Token 的推理成本。
行业进入「工业时代」
2026 年的 AI 大模型行业,已经从「能不能做出好模型」的工程师时代,进入「能不能把成本降到足够低」的工业时代。能否推出并规模化使用自研推理芯片,将决定这些公司究竟是一家 AI 产品公司,还是 AI 时代的基础设施公司。
