AICC2026 大会多场讨论显示,智能体落地推动 AI 芯片评判从纸面 TOPS 转向端到端效率、长周期稳定性与全栈生…
智能体(Agent)从演示原型走向生产级落地,正在让 AI 芯片的评判标准发生根本性迁移。过去十年,行业习惯追逐单芯片纸面峰值算力,但来自一线业务的反馈不断表明:长周期运行、多轮交互、频繁工具调用的 Agent 任务,会持续暴露出存储、调度与异构协同层面的隐性瓶颈。9 月 21 日落幕的 AICC2026 人工智能计算大会上,多位产学界嘉宾围绕这一议题展开讨论,传递出一个清晰信号:芯片竞争的焦点,正从器件与裸片性能,转向覆盖器件、芯片、存储互联、操作系统与推理框架的全栈生态较量。
Agent 带来的变革并非简单的算力需求暴涨,而是一整套负载范式的根本性迁移。IDC 副总裁周震刚在大会现场发布的《2026 中国人工智能计算力发展评估报告》中,将算力需求爆发拆解为任务执行频次、单任务 Token 消耗、多智能体协同三重乘数。生产环境下的智能体属于长周期任务,会涉及海量知识库读取、多轮推理生成、外部工具调用、会话状态留存、出错回滚重试,并需要支撑大规模实例并发运行。
负载形态的改变直接重塑了硬件与系统协同的分工关系。浪潮信息首席 AI 战略官刘军谈到,进入 Agent 阶段后,AI 不再只是完成一次模型调用,而是需要持续进行任务规划、工具调用、状态管理、结果校验与多轮迭代,计算负载因此变得更长、更复杂,也更加动态,对 CPU、加速器、内存、存储、互联以及系统软件的协同提出新要求。工信部电子五所软件与系统研究院高级副院长蒋沛航也观察到,不少芯片在标准化基准测试中跑分优异,但投入 Agent 真实生产环境后,面对多步骤、高并发任务极易出现中断与输出跑偏——硬件纸面性能并不等同于真实业务场景下的可用能力。
智能体场景下,长上下文带来巨大压力,KV Cache 规模持续膨胀,会引发内存溢出、首字时延恶化、Token 间隔抖动等连锁问题。内存容量、带宽、片间互联、资源隔离、全局任务调度,都有可能转化为系统瓶颈。
过去十年 AI 算力实现数百倍增长,但内存带宽提升远远跟不上算力扩张的速度。Agent 业务需要持续生成、更新、保存大量 KV Cache 与任务状态,进一步放大访存压力,存储与计算系统之间的协同变得更加关键。
对于存算一体这条被寄予厚望的技术路线,清华大学副校长吴华强结合团队实践给出清醒判断:不能把希望完全寄托在器件单点突破,器件、工艺、电路、架构,直至编译器、推理框架,完整全栈协同缺一不可。存算一体在 RAG 检索、向量数据库这类访存密集场景能释放突出能效收益,但模拟计算本身存在器件波动、阵列映射等难题,更适配特定访存密集场景,难以全场景通吃完整智能体业务链路。
单颗芯片受面积、功耗、工艺物理上限约束,Chiplet 与 3D 混合堆叠成为另一条重要解题思路。北极雄芯创始人兼首席科学家马恺声预判,未来一到两年,行业将迎来大参数量模型、高 Token 吞吐、上千容器协同、上千小时不间断运行的 Agent 系统,单颗芯片难以覆盖全部业务诉求。Chiplet、3D 堆叠的核心价值在于拆分组合带来的架构弹性,以此缓解模型迭代快、硬件研发周期漫长的矛盾。
不过先进封装并非万能。算苗科技首席 AI 科学家楼建光指出,3D 堆叠可将互连距离压缩至微米级别,大幅提升带宽、降低数据搬运功耗,但良率管控、散热设计、配套软件生态都是落地阻碍,不能简单把现有 GPU/NPU 架构直接照搬复用,需要面向 Transformer 做以内存为中心的原生架构设计。芯动科技 DDR 产品线总监张杰补充道,Agent 任务往往持续十几分钟甚至更久,内存一旦出现关键数据错误,就会造成整段已完成任务全部作废——面向 Agent 业务,内存运行稳定性的地位已提升到与性能同等重要。
Agent 混合负载的兴起,正在拓展 RISC-V 的应用边界,使其从传统 MCU、低功耗嵌入式场景进一步走向服务器与 AI 计算领域。进迭时空科技产品负责人朱伟东结合一线研发经验谈到,过去行业对 RISC-V 的印象大多停留在端侧、MCU 领域,但 Agent 时代长上下文、大规模 KV Cache、7×24 小时不间断运行的诉求,把服务器级别的可靠性要求摆到台前。一颗服务器芯片的成败,不只取决于 CPU 核本身跑分,RDMA 网络、虚拟化、操作系统适配、AI 推理框架整套底座是否完备至关重要,在不少场景下软件生态建设的投入甚至超过硬件 IP 研发本身。
面向 AI 混合负载,RISC-V 需要引入 AI 向量、矩阵指令扩展,而扩展行为天然伴随生态碎片化风险。大会对 IME、VME、AME 三条 AI 指令扩展路线进行了梳理,不同方案在寄存器组织、计算单元设计上各有取舍。若各家大量采用私有定制扩展,上层推理框架就要承担繁重的适配工作,推动形成社区公认的公共指令标准才是降低产业负担的可行路径。北京开源芯片研究院首席科学家谢涛指出,RISC-V 的开放不能止步于指令集本身,应把视角从硬件 IP 拉升至完整系统生态——RISC-V 通过矩阵、张量指令扩展把 AI 计算能力变成 CPU 指令集原生能力,走向同构计算,可削减数据搬移开销、简化编程模型。
指令集标准仅是起点,软件栈主线化适配是绕不开的难题。朱伟东提到,当下不少 RISC-V 相关代码还停留在厂商私有分支,没有合入 Linux 内核、PyTorch 等上游主线,上游版本迭代后下游就要持续同步维护,成本居高不下。智源研究院 FlagOS 开源软件栈的实践同样证明,无论硬件设计如何先进,都需要编译器、算子库、模型 Day-0 适配、自动化部署工具承接;国内数量众多的异构国产算力亟需统一的南向适配框架,把分散的硬件能力转化为上层业务可调用的算力。
综合大会讨论可以得出结论:不存在单一芯片架构能够完整承接 Agent 的全部业务链路。存算一体在高访存场景具备能效优势,但不擅长处理大量通用分支任务;3D-Chiplet 带来架构弹性,落地却受制于良率、散热与软件配套;RISC-V 具备开放灵活的底座,但价值释放高度依赖公共指令标准、操作系统、推理框架共同组成的完整软件体系。无论采用哪一种硬件路线,面向长时间运行的 Agent 业务,内存子系统的稳定性都是产业选型不可忽视的关键权重。
国内拥有多元化硬件路线、完整产业链,同时积累大量 Agent 落地场景。如何依托系统层面的协同创新,把碎片化的异构硬件整合成稳定、可负担、能够规模化供给的 Agent 算力底座,将成为未来持续发展的关键议题。在智能体掀起的这场变革中,芯片架构创新仅仅是上半场,全栈生态比拼才是算力能否落地的关键。