Global AI memory研报解读
报告认为,训练、推理、RAG 和智能体工作流分别需要不同组合的 HBM、DRAM、SSD 和共享存储。报告将解码阶段 KV cache 的增长视为核心内存约束,并认为这将推动新的内存层级和架构。
摘要
报告认为,训练、推理、RAG 和智能体工作流分别需要不同组合的 HBM、DRAM、SSD 和共享存储。报告将解码阶段 KV cache 的增长视为核心内存约束,并认为这将推动新的内存层级和架构。
- 训练依赖从 HBM 到 DRAM、本地 SSD 和网络存储的所有内存层级。
- 推理预填充受计算限制,而解码因 KV cache 随 token 和并发用户数增长而受内存限制。
- CXL、Storage Next 和 CMX 旨在传统系统内存、本地 SSD 和共享存储之间增加新层级。
- HBF、zHBM、NVHBM、PIM 和存储级内存等新兴方案试图解决容量、带宽、延迟或成本之间的取舍。
研报解读
概览
这份入门报告解释不同内存技术在 AI 系统中的位置。Bernstein 围绕工作负载差异及两套互补层级展开讨论:按内存在系统中位置划分的架构层级,以及按存储机制和封装划分的硬件层级。
核心观点
Bernstein 从基于 Transformer 的大语言模型工作负载切入,因为不同任务的内存需求存在显著差异。训练既高度依赖计算,也高度依赖带宽,因而 HBM 对模型规模和计算速度至关重要;但训练也需要用于数据集的低成本容量、用于流水线暂存的更快层级以及检查点存储,因为训练可能持续数月。因此,报告将系统 DRAM、本地 SSD 和网络存储视为 HBM 的必要补充,而非替代品。 推理分为预填充和解码。预填充处理提示词并生成首个 token;其通常受计算限制,因为大型矩阵运算会让 GPU 保持高利用率,因此加速器内部的 HBM 相对更重要。其关键延迟指标是首 token 时间(TTFT):报告称,对聊天机器人而言约 0.5 秒或更低较理想,1 秒可以接受;超过 2 秒除大型任务外可能令用户感到沮丧。解码以自回归方式逐个生成 token。为避免重复计算,模型会在 KV cache 中保存此前 token。模型权重是静态的,可由多名用户共享;但 KV cache 数据会随每个 token 更新,且因用户而异,使容量需求随 token 数量和并发用户数共同增长。Bernstein 因此将解码描述为受内存限制,并认为在大规模部署中 KV cache 可能超过模型权重,限制上下文窗口、并发量、部署规模及潜在收入能力。每个输出 token 时间(TPOT)是解码的关键指标;报告给出文本聊天约 50 ms,以及实时语音、编程和智能体应用等高要求场景低于 10 ms 的参考标准。 RAG 带来不同的存储模式。从大量非结构化数据创建向量数据库,需要大量 SSD 或 HDD 容量,以及用于构建索引的系统 DRAM,HBM 使用相对较少;Bernstein 将这种离线准备描述为一次性成本,与用户数和 token 数量无关。搜索阶段通常先用 HBM 快速将查询转为向量,但系统 DRAM 在寻找最近匹配项时的作用通常大于 HBM 或 SSD。检索到的内容随后进入常规预填充和解码。智能体工作流进一步放大这一问题:多步骤智能体需要内存保存计划、分支和中间状态;使用外部工具时会增加传统 CPU 和系统内存需求;其输出反复进入后续推理阶段,从而提高预填充、解码和 KV cache 需求。 架构层级从顶部的超低延迟片上 SRAM,依次延伸至 HBM、系统 DRAM、CXL 内存和 Storage Next,再到本地 SSD、CMX 以及共享 SSD/HDD/磁带存储。HBM 位于片上内存之下,因为与加速器共同封装可为活跃的模型权重和 KV cache 提供高带宽、低延迟。系统 DRAM 容量更高但延迟也更长。CXL 用于将物理分离的内存组成池化资源,也可扩展至通过 DRAM 或 SRAM 缓存而更接近 DRAM 特性的 NAND 产品。Storage Next 被描述为 NVIDIA 牵头的项目,旨在将内存管理转向 GPU,并利用 NAND 更低成本和更大容量的同时改善延迟、IOPS 和访问粒度;Bernstein 将其置于 DDR DRAM 和本地 SSD 之间。CMX 是跨计算节点、针对 KV cache 优化的共享 SSD 层级;NVIDIA 的 STX 参考架构旨在支持互操作性。本地 SSD 扩展节点级容量,而共享 SSD、HDD 和磁带则处理耐久或对延迟不敏感的数据。 硬件层级解释了上述各层级背后的技术取舍。SRAM 延迟最低,但占用的硅面积大于 DRAM,因此适合片上缓存。HBM 是与 XPU 相邻封装的 DRAM;传统 DRAM 同样用于系统内存,也可用于 CXL 产品。Bernstein 强调 DRAM 仍通过更小制程节点持续演进,指出 EUV 具有战略重要性,并讨论 4F² 和 3D DRAM 作为中国的研发路径;4F² 可能带来一次性的密度改善,而 3D DRAM 可能拥有更长的扩展路径,但技术难度更高,且距离商业化仍可能需要数年。 报告考察了多种 HBM 和 DRAM 创新。Samsung 的 zHBM 将 HBM 堆叠置于 XPU 顶部以缩短连接,但 Bernstein 质疑 DRAM 能否承受处理器热量,以及混合键合的良率和成本是否已具备商业化条件。NVIDIA 的 NVHBM 将基底芯片设计转交 NVIDIA,可能降低 XPU 芯片成本、扩大计算面积、提高带宽并降低功耗,但也会使存储器供应商的一部分差异化被标准化,并将制造价值转向晶圆代工厂。Intel 的 XBM 和 ZAM、Qualcomm 的 HBC,以及 MRDIMM、SOCAMM2 和 LPCAMM2 等模块形态,均被视为改善带宽、散热或功耗的替代路径。HBC 通过避免 CoWoS 中介层,以部分性能换取较低封装成本,并采用 LPDDR;Qualcomm 目标是在 fiscal 2027 推出第一代、2028 推出第二代。 对于 NAND 和存储级内存,Bernstein 将增强型 NAND 产品定位在 DRAM 与普通 SSD 之间。Z-NAND 和 XL-FLASH 通过 SLC 或 MLC 牺牲部分容量和成本优势,以换取更低延迟和更高 IOPS;报告称 KIOXIA 的 GP-series SSD 在 2026 年可达 10M IOPS,并在 2027 年超过 100M。报告将基于 SLC/MLC 的 XL-FLASH 归入类似 Storage Next 的应用,将 TLC 用于兼顾成本与性能的 CMX 产品,并将 QLC 用于与 HDD 竞争的高容量产品。由 SanDisk 和 SK hynix 牵头的 HBF 旨在通过 NAND 更低成本和更高容量补充 HBM,同时接近 HBM 带宽;但 Bernstein 强调,跨越多个硬件层级的性能鸿沟在技术上很困难。HDD 仍适合低成本、低频访问的冷数据,报告称蓬勃增长的存储需求和 KV cache 溢出需求正使其受益;报告还提到,在 NAND 和 HDD 供应不足的情况下,磁带需求也出现增长。 最后,PIM 将处理与内存集成在同一硅片上,以减少数据移动这一关键计算瓶颈。Bernstein 认可其潜在价值,但强调其采用仍很有限,因为 PIM 偏离了既有的处理与内存分离架构,并需要对处理器、软件、网络和供应链进行广泛重构。
分析框架
Bernstein 首先按计算、带宽、容量或延迟何者构成约束来划分 AI 工作负载,随后按系统位置和用途建立架构层级,再按单元设计、封装和存储机制建立硬件层级。报告借此解释成熟和新兴技术在成本、容量、带宽与延迟之间的取舍。
方法论与常识提炼
AI 内存架构层级与硬件层级
报告从片上 SRAM、HBM、DRAM、SSD 到共享存储建立内存映射,以说明工作负载需求如何贯穿 AI 内存供应链。
按工作负载划分的内存需求
分析区分训练、预填充、解码、RAG 和智能体工作流,以解释哪些内存资源会成为约束以及原因。
标的映射与对比
研报将主题/逻辑映射到具体标的时的结构化摘要(优势、劣势、对比与风险)。
- Samsung Electronics (005930.KS)被覆盖的存储器供应商,并开发 zHBM、CXL 内存模块和 Z-NAND。
- 优势
- 报告重点提及 zHBM、CMM-H 混合 CXL 内存模块和 Z-SSD 产品。
- 对比
- zHBM 试图通过将堆叠置于 XPU 顶部而超越标准 HBM。
- 风险
- Bernstein 对 zHBM 的热性能以及混合键合的良率和成本成熟度提出疑问。
- SK hynix (000660.KS)被覆盖的存储器供应商和 HBF 参与者。
- 优势
- 报告将 SK hynix 与 SanDisk 并列为 HBF 领导者,并以其产品举例说明 HBM。
- 对比
- HBF 旨在以基于 NAND 的更高容量和更低成本来补充 HBM。
- 风险
- HBF 必须克服 NAND 与 HBM 之间显著的性能差距。
- Micron (MU)被覆盖的存储器供应商和 Storage Next 参与者。
- 优势
- 报告将 Micron 的 XTR SSD 作为 pSLC 的例子,并将其列为 Storage Next 合作方。
- 劣势
- NVHBM 可能削弱存储器供应商在基底芯片上的差异化。
- 对比
- 报告将 Micron 与 Samsung 列为标准 HBM 中生产基底芯片的供应商。
- 风险
- NVHBM 基底芯片的标准化可能将价值转向 NVIDIA 和晶圆代工厂。
- KIOXIA (285A.T)被覆盖的 NAND 和 SSD 供应商;其 GP-series SSD 被用作 Storage Next 的例子。
- 优势
- 报告以 XL-FLASH GP-series SSD 的超高 IOPS 和其在 Storage Next 层级中的定位为例。
- 对比
- 其基于 SLC/MLC 的 XL-FLASH 以延迟和 IOPS 为优先,代价是牺牲 TLC 的密度经济性。
- SanDisk (SNDK)被覆盖的 NAND 供应商和 HBF 领导者。
- 优势
- 报告将 SanDisk 认定为 HBF 领导者,并用其 HBF 设计说明总内存容量的提升。
- 对比
- HBF 旨在利用成本更低、容量更高的 NAND 补充而非替代 HBM。
- 风险
- NAND 要接近 HBM 带宽,所需的性能提升存在很高技术门槛。
- Seagate (STX)被覆盖的存储公司,与较低层级的共享存储相关。
- 对比
- HDD 在内存层级中低于 NAND,但仍适合低成本冷存储。
- Western Digital (WDC)被覆盖的存储公司,与较低层级的共享存储相关。
- 对比
- 报告将 HDD 描述为适用于耐久、对延迟不敏感数据的 G4 共享存储选择。
关键数据
- 理想的聊天机器人 TTFT0.5 seconds or lower报告称这是首 token 时间的理想水平;1 秒可以接受。
- 大型任务可能可接受的 TTFTMore than 2 seconds报告称,对于消化 100 页 PDF 等任务可能可以接受,但可能令用户感到沮丧。
- 文本聊天 TPOTUp to 50 ms每个输出 token 时间的示例性可接受水平。
- 高端场景 TPOTLess than 10 ms实时语音、编程和智能体工作负载的示例性要求。
- KIOXIA GP-series SSD IOPSUp to 10M in 2026; 100M+ in 2027用于说明基于 XL-FLASH 的高 IOPS 存储。
- Qualcomm HBC 时间表Gen-1 in fiscal 2027; Gen-2 in 2028报告引用的公司目标。
影响与含义
Bernstein 的框架表明,AI 内存需求并不局限于 HBM:扩大上下文窗口、提高并发使用、RAG 数据集和智能体工作流,都可能增加对 DRAM、SSD、HDD 及新型中间层级的需求。报告强调,每种方案的技术与商业价值取决于其改善的是延迟、带宽、容量还是成本瓶颈。
风险
- HBF 面临很高技术门槛,因为 NAND 必须跨越较大的性能差距才能补充 HBM。
- zHBM 在商业化生产前可能面临散热、混合键合良率和成本挑战。
- PIM 的采用有限,因为它需要对处理器、软件、网络和供应链架构进行重大调整。
- 3D DRAM 技术难度较高,距离商业化可能仍需数年。