伯恩斯坦评论七大内存:HBM之后,DRAM与NAND争夺下一个万亿市场
TL;DR
·AI 对存储的需求并不止于 HBM。训练几乎需要调动从 HBM、系统 DRAM 到 SSD 和共享存储的完整内存体系。
·推理的真正瓶颈出现在解码阶段。KV Cache 会随上下文长度和并发用户数共同增长,内存容量可能比模型权重更早限制商业化规模。
·Agent 进一步放大存储压力。多步骤调用会反复产生上下文、调用外部工具,并增加 CPU、DRAM 和 KV Cache 需求。
·HBM 与传统 SSD 之间正在出现多个新层级,包括 CXL、「Storage Next」和 CMX,目标都是以更低成本承接不断扩大的推理数据。
·新技术路线并非都能落地。HBF、zHBM、NVHBM、ZAM 及 PIM 各自面临散热、良率、生态兼容或供应链利益重分配等问题。
·伯恩斯坦继续看好三星电子、SK 海力士、美光、闪迪、希捷和西部数据,对铠侠维持「跑输大盘」评级。
过去两年,AI 存储的市场叙事几乎都围绕 HBM 展开。但随着大模型从训练走向大规模推理,单纯增加 HBM 已经难以解决全部问题。
伯恩斯坦在最新发布的全球存储报告中指出,不同 AI 工作负载对内存的要求差异明显:训练强调算力和带宽,推理中的解码阶段更依赖容量,RAG 需要大规模数据库,而 Agent 工作流会同时增加传统服务器与 AI 服务器的负担。
这意味着,AI 带来的变化正在从 HBM 向下传导至系统 DRAM、SSD、HDD,甚至磁带存储。围绕「内存墙」,产业链开始在原有层级之间插入新的产品,希望在性能、容量和成本之间找到新的平衡。
推理规模的上限,可能取决于 KV Cache
在大模型训练阶段,GPU 和 HBM 仍然处于核心位置。
训练需要频繁读取模型参数和中间数据,对计算能力和内存带宽的要求都很高。但一个大型模型的训练并不只依赖 HBM:原始数据集需要保存在成本更低的存储介质中;数据进入 GPU 前,通常需要由系统 DRAM 和本地 SSD 完成缓存与预处理;持续数周甚至数月的训练还要定期保存检查点,以免硬件或软件故障导致任务从头开始。
因此,一次大型训练实际上会调用从 HBM、系统 DRAM 到本地 SSD 和网络存储的完整体系。
进入推理阶段后,内存需求进一步分化。
推理通常可以拆分为预填充(Prefill)和解码(Decode)两个环节。预填充负责处理用户输入并生成第一个 Token,主要执行大规模矩阵运算,更偏向「算力受限」。在这一阶段,GPU 利用率和 HBM 带宽更加重要,常用指标是首 Token 延迟。
解码阶段则不同。模型需要逐个生成 Token,并在生成新 Token 时调用此前产生的信息。为避免重复计算,系统通常会将这些数据保存在 KV Cache 中。
KV Cache 具有两个重要特征:其容量会随上下文长度线性增加,每名用户又需要独立缓存。因此,当上下文变长、并发用户增加,两项因素会共同推高内存占用。
伯恩斯坦认为,在大规模 AI 部署中,KV Cache 占用的内存可能超过模型权重,成为限制并发用户数和上下文窗口的主要因素。模型能服务多少用户、维持多长上下文,最终会直接影响收入规模。
由此来看,推理时代的竞争重点不只是芯片能完成多少计算,也包括系统能以多低的成本保存和读取不断扩大的上下文。
RAG 和 Agent,把需求推向传统内存
RAG 与 Agent 的普及,让 AI 存储需求进一步向 HBM 之外扩散。
RAG 主要包括数据库构建和数据库检索两个环节。构建数据库时,系统需要处理 PDF、网页、代码等大量非结构化数据,再将其转换为可搜索的向量及索引。这一过程更依赖大容量 SSD 和系统 DRAM,HBM 的作用相对有限。
数据库建立后,用户查询首先会被转换为向量,随后与数据库中的内容进行匹配。向量生成可以快速在 GPU 和 HBM 中完成,但真正的搜索通常更依赖系统 DRAM。检索结果再与用户问题合并,进入正常的预填充和解码流程。
Agent 工作流带来的负担更重。
传统对话通常是「输入—模型—输出」的单次调用,Agent 则需要把目标拆分成多个步骤,调用其他模型或外部工具,保存中间结果,并根据反馈重新规划。每次调用产生的结果,又可能成为下一次模型调用的输入。
这会同时增加两类需求:一方面,工具调用与非 AI 任务需要更多 CPU 和系统内存;另一方面,多个模型之间不断传递上下文,会迅速扩大预填充、解码和 KV Cache 负担。
因此,Agent 应用的发展并不只利好 GPU 和 HBM,也可能推升服务器 DRAM、企业级 SSD 及更低成本存储介质的需求。
HBM 与 SSD 之间,正在长出新的内存层级
传统服务器的内存体系大致可以分为处理器内部缓存、系统 DRAM、本地 SSD 和共享存储。AI 服务器在这一结构中加入了 HBM,但 HBM 容量有限且成本较高,难以承担全部数据。
产业链目前的解决方式,是在不同层级之间加入新的产品。
CXL 试图把物理上分散的内存整合成共享资源池,让 CPU、GPU 和扩展设备更灵活地调用 DRAM。部分产品还将 DRAM 或 SRAM 作为缓存,与 NAND 组合,在降低成本的同时缩短访问延迟。
由英伟达推动的「Storage Next」,则试图把部分存储管理从 CPU 转向 GPU,并让 NAND 获得更接近 DRAM 的延迟、IOPS 和数据访问粒度。铠侠基于 XL-FLASH 推出的 GP 系列 SSD,就是这一方向的代表。
CMX 主要面向 KV Cache。它将 SSD 部署在独立数据节点中,通过 DPU、以太网和交换芯片与计算节点连接。其目标是在不同 GPU 之间共享推理上下文,降低重复存储,同时突破单台服务器的内存容量限制。
这些方案共同指向同一个趋势:AI 系统无法把所有活跃数据长期放在 HBM 中,需要按照数据的访问频率与延迟要求,将其分散到不同层级。
热数据留在 HBM,部分上下文转移至系统 DRAM 或高性能 SSD,更冷的数据继续下沉至普通 SSD、HDD 甚至磁带。内存层级越细,系统越有可能在性能与成本之间取得平衡。
新技术密集出现,但商业化仍有不确定性
围绕「内存墙」,产业链已经提出多条新路线。
三星的 zHBM 计划将 HBM 堆叠在处理器上方,进一步缩短数据传输距离。不过,这一设计需要处理 GPU 产生的热量,同时对晶圆级混合键合的良率和成本提出更高要求。
英伟达推动的 NVHBM 则将基础裸片交由英伟达设计,并可能由台积电制造。该方案有望降低功耗、提高带宽,但也可能削弱存储厂商在 HBM 基础裸片上的设计和制造价值。随着产品标准化,部分附加值可能由存储厂商转移至英伟达和晶圆代工厂。
闪迪和 SK 海力士推动的 HBF,希望利用 NAND 提供接近 HBM 的带宽,同时获得更大的容量和更低的单位成本。不过,NAND 与 DRAM 在延迟和性能上仍存在显著差距,HBF 需要跨越多个技术层级,落地难度并不低。
英特尔的 ZAM 尝试将 DRAM 裸片旋转 90 度,以改善散热,目标是在 2029 财年实现实用化;高通的 HBC 则使用 LPDDR 和传统封装,以牺牲部分性能为代价绕开 CoWoS 成本。
此外,PIM 试图直接在存储芯片中加入计算能力,以减少处理器与内存之间的数据搬运。但这会改变现有计算架构,需要处理器、软件和网络共同适配,也会冲击已经高度成熟的逻辑芯片与存储芯片分工体系。伯恩斯坦认为,其行业采用仍然有限。
由此来看,新方案数量快速增加,并不意味着所有路线都能形成规模市场。能否兼容现有软件和硬件生态、是否具备成本优势,以及供应链各方能否达成利益平衡,将决定最终的商业化结果。
AI 存储受益者,不会只有 HBM 厂商
从投资角度看,伯恩斯坦的判断较为明确:AI 对存储产业的拉动正在从少数高端产品扩散至更多层级。
HBM 仍然是训练和高性能推理的核心,三星电子、SK 海力士和美光将继续受益于高带宽存储需求。但推理规模扩大后,系统 DRAM 和 NAND 的重要性会上升。KV Cache 溢出、RAG 数据库以及 Agent 产生的大量中间数据,也会增加 SSD 和共享存储需求。
更冷的数据还会继续下沉。伯恩斯坦称,AI 带来的数据增长已经开始惠及 HDD;在部分场景下,由于 NAND 和 HDD 容量不足,传统上主要用于归档的磁带需求也在增加。
报告继续给予三星电子、SK 海力士、美光、闪迪、希捷和西部数据「跑赢大盘」评级。其中,三星电子、SK 海力士和美光对应 DRAM 及 HBM,闪迪受益于 NAND 和 HBF,希捷与西部数据则对应更低成本的大容量存储。铠侠被评为「跑输大盘」。
不过,这份报告的核心价值并不在于列出一批新技术缩写,而是重新定义 AI 存储市场的边界。
训练时代的瓶颈主要集中在 GPU 和 HBM;推理与 Agent 时代,瓶颈开始沿整个内存体系扩散。未来 AI 基础设施的竞争,既取决于芯片能算得多快,也取决于数据能否以足够低的成本,在 HBM、DRAM、NAND 和共享存储之间高效流动。
免责声明:文章中的所有内容仅代表作者的观点,与本平台无关。用户不应以本文作为投资决策的参考。
你也可能喜欢
九月,标普500将迎“最差月份”:AI板块疲态未消,分析师转向谨慎
标普500指数处于历史高位,但市场风险正在积聚。摩根大通Hunter警告AI板块仍显疲软,调整尚未结束;Ned Davis Research的Stockton认为市场情绪已明显过热;BTIG的Krinsky则指出资金轮动动能不足。叠加9月历来偏弱的季节性因素,多位分析师警告,标普500短期回调风险正在上升。
Anthropic超级IPO在即,美国IPO市场掀起“抢跑潮”
Anthropic酝酿堪比SpaceX的历史性IPO,为争取资金关注,多家企业争相抢跑。但美国劳工节、美联储议息、中期选举三重时间节点将窗口压缩至极限。巴克莱Rob Stowe预计劳工节后至大选前将出现高度集中的发行窗口。
高温天气推升制冷需求 美国天然气期货小幅走高 LNG出口需求升至6月底来最高
美国天然气期货周一小幅上涨,近期天气预报显示未来数日美国南部、东部以及东海岸大部分城市将迎来高温天气,空调制冷需求预计上升,从而增加电力行业对天然气的需求

从恐慌转向贪婪, BTC 能否站稳 52 周均线 | 特邀分析

