桃子桃子快讯
返回首页
行业动态

AI Agent 重塑存储层级:SSD 与 HBM 边界再划分

AI Agent 让存储从落盘终点进入推理循环,HBM、HBF、DRAM 与 SSD 的价值边界被重新定义。

2026.08.11 · 周二6 分钟阅读

AI Agent 正在把计算机从「接到问题后完成一次模型调用」,变成持续观察、推理、调用工具、修改环境并保留状态的运行系统。一次任务可能连续访问模型、记忆、向量索引、业务数据库、对象存储和网络服务,并把工具结果、执行轨迹、用户偏好、临时上下文与审计记录不断写回。Agent 运行时间越长,价值越依赖数据能否被安全保存、正确检索、及时更新和低成本复用。这意味着存储不再只是落盘终点,而会逐步进入 Agent 的感知、记忆和决策循环。

存储能力向介质靠拢,"功能型 SSD" 雏形显现

加密、压缩、索引、记忆与上下文服务向存储侧下沉,正在模糊 SSD、DRAM、HBM 与 HBF 的传统边界。自加密盘已可在控制器内透明完成数据加解密;计算存储标准把压缩、加密、正则过滤和纠删码列为可由存储侧执行的功能;Samsung SmartSSD 等产品也曾把数据库扫描和视频处理下沉到盘侧。Agent 时代的新意,是这些能力不再只服务通用数据处理,而开始围绕智能体身份、上下文、记忆、工具轨迹与 Token 成本重新组合。

未来可能出现「安全 SSD」「压缩 SSD」「检索 SSD」「记忆 SSD」或「上下文 SSD」等形态,也可能汇合成可编程的功能型 SSD:基础形态兼容标准存储,上层软件按场景发现和调用设备功能。NVMe 已形成 Computational Programs 与 Subsystem Local Memory 等命令集,为设备侧程序的发现、配置与执行提供标准化路径。真正的产业问题不只是能否在盘内放一颗处理器,而是谁来定义数据语义、功能边界与端到端结果。

数据契约更复杂,存储要能"识别"记忆

传统聊天机器人的持久对象主要是对话记录,Agent 则会制造更复杂的数据图:观察结果、工具输出、计划与反思、任务中间状态、用户画像、环境快照、检索证据、执行日志,以及模型侧的 KV Cache、Prefix Cache、Adapter、专家权重与 Checkpoint。不同对象的更新时间、复用范围和安全等级不同,却共同决定后续推理能否延续。

近期从数据管理视角对 Agent Memory 的系统研究,将其拆为表示与存储、信息提取、检索与路由、维护四个模块,并指出没有单一架构能在所有工作负载上占优。Mem0 等系统强调把原始对话转化为更紧凑、可复用的长期记忆,以降低长会话中的输入 Token 与检索负担。功能型 SSD 的合理角色,是在 Runtime 给出对象与策略之后,按租户选择密钥、按生命周期放置数据、维护索引页与元数据,并把尾延迟、写放大与介质健康反馈给上层;语义决策留给 Agent 与 Runtime,数据执行尽量靠近介质。

端侧与云侧:SSD 的两种新角色

端侧 Agent 需要持续接触个人文档、照片、邮件、日程与应用状态。统一内存只适合当前工作集,SSD 则可以保存更大的本地模型库、Adapter、向量索引与个人记忆。在标准 NVMe 形态下,功能型 SSD 可作为普通系统盘安装于 AI PC 与工作站,再通过驱动、Runtime 与固件逐步开启安全、索引与上下文能力。商业模式会从容量升级延伸到 AI PC 溢价、本地 Agent 订阅与私有 AI 节点;但本地存储并不自动等于隐私,应用隔离、用户同意、可验证删除与密钥吊销必须成为产品能力。

云侧 Agent 的状态规模更大,更需要共享:节点本地 SSD 保存模型、Checkpoint 与高频索引,机架或 POD 级 Flash 层承接跨 GPU 复用的 KV、Prefix、Adapter 与共享记忆,通用对象存储继续承担冷态与长期事实源。Mooncake 已把 CPU、DRAM、SSD 与 RDMA/NIC 组织为分布式 KV Cache 池,由调度器根据缓存位置与 TTFT、TBT 目标决定请求路径;NVIDIA CMX 则在 HBM、主机内存与通用共享存储之间建立面向 KV Cache 的 POD 级 Flash 上下文层。这些系统说明「存储节点参与 Token 生产」正在从概念走向基础设施产品。

HBM、HBF、DRAM、SSD 价值边界再划分

Agent 不应被理解为 SSD 取代内存。SK hynix 在 FMS 2026 提出的 Tiered Memory 思路,是把 HBM、DRAM、NAND/HBF 与 SSD 按速度、容量与成本分层连接,重点减少数据移动:当前 Token 必须使用的数据、未来几毫秒将使用的数据、跨会话可能复用的数据与长期归档数据,需要不同介质承接。

  • HBM:仍是最接近 GPU 计算的核心层,承载权重、激活、热 KV 与算子中间状态;Agent 带来长上下文与多模型协作,会进一步推高其需求。
  • HBF:SK hynix 与 Sandisk 于 2026 年 8 月公布的首批开放规格覆盖最高 512GB 容量,带宽分约 0.4TB/s 至 3.0TB/s 三档,采用 UCIe 连接处理器,适合模型权重、MoE 专家与读密集的大型推理工作集。
  • DRAM / CXL:处于可变状态与共享容量的中间地带,适合 Host KV、索引热集、预取缓冲与 Agent 运行状态。
  • 功能型 SSD:承担更大、更持久、更需要治理的温冷对象,包括模型、Adapter、KV/Prefix、向量索引、Agent Memory、日志与 Checkpoint。

未来竞争不会只围绕介质带宽展开,而会围绕谁能在正确期限内交付正确对象,并为有效 Token、检索吞吐与数据治理负责。价值边界正从半导体器件延伸到数据基础设施本身。

信源