ARTICLE · 人工智能

AI SSD:大模型推理的存储范式转移

作者:思邈 来源:量子位 2026-08-07 10:56 26 分钟 6347 字
AI Infra大模型推理KV CacheAI SSD算存协同
一语总结

本文深入探讨了大模型推理(长上下文、MoE 及智能体)带来的存储范式转移,分析了 Mooncake 与 NVIDIA CMX 等架构创新,并系统梳理了当前 AI SSD 的技术路线与产业格局。

AI 总结

随着大模型进入长上下文和多智能体时代,KV Cache 与 MoE 专家权重的实时调度成为制约 GPU 效率的瓶颈,推动 AI 基础设施从“堆叠算力”走向“算网存协同”。文章重点剖析了月之暗面 Mooncake(以 KV Cache 为中心的分离式架构)与 NVIDIA CMX(Pod 级上下文存储平台)两大行业信号,指出 Flash 已被纳入推理内存体系。针对这一变革,AI SSD 正在分化为“AI 负载强化型”与“推理参与型”两类,后者以群联(显存扩展)、江波龙(存储侧智能化)及寅谱-联芸(算存协同)为代表,共同重构大模型推理的数据路径。

核心要点
  1. AI 基础设施正从“堆叠计算”转向“算网存协同”。

    长上下文、MoE 和多智能体使推理状态(如 KV Cache)成为一级资源,GPU 的实际利用率高度依赖于数据能否在正确时间到达计算节点。

  2. Mooncake 与 NVIDIA CMX 标志着存储正式进入 Token 生成的实时主链路。

    Mooncake 采用“以存储换计算”的分离式架构调度分布式 KV Cache;NVIDIA CMX 则在 HBM 与本地 SSD 之间引入 G3.5 闪存层,释放了 Flash 作为推理内存正式一层的产业信号。

  3. AI SSD 正在从被动响应块设备命令走向主动参与推理运行时管理。

    传统 SSD 无法满足大模型推理的严格时序约束。新型“推理参与型”AI SSD 通过主控、固件、中间件与推理运行时的协同,实现专家权重与 KV Cache 的智能分层与预测式预取。

  4. 行业分化出群联、江波龙、寅谱-联芸三种不同的推理参与型技术路线。

    群联主打显存扩展中间件,江波龙强调存储侧 SPU 智能化,而寅谱-联芸则从 AI Native 视角出发,实现计算侧缓存与存储介质的深度算存协同。

AI SSD:大模型推理的存储范式转移

随着大模型进入长上下文和多智能体时代,KV Cache 与 MoE 专家权重的实时调度成为制约 GPU 效率的瓶颈,推动 AI 基础设施从“堆叠算力”走向“算网存协同”。文章重点剖析了月之暗面 Mooncake(以 KV Cache 为中心的分离式架构)与 NVIDIA CMX(Pod 级上下文存储平台)两大行业信号,指出 Flash 已被纳入推理内存体系。针对这一变革,AI SSD 正在分化为“AI 负载强化型”与“推理参与型”两类,后者以群联(显存扩展)、江波龙(存储侧智能化)及寅谱-联芸(算存协同)为代表,共同重构大模型推理的数据路径。

文章金句

"

推理状态正在成为 AI 基础设施中的一级资源,存储也开始进入 Token 生成的实时主链路。

"

用更多存储换取更少计算。

"

计算芯片负责执行算子,网络连接资源,存储则需要参与推理状态的放置、迁移和复用。

"

真正决定产品能否进入推理主链路的,是企业能否建立从 NAND 介质、FTL、固件、驱动、中间件到推理框架和整机验证的完整协作体系。