Global AI memory研报解读
Bernstein说明,训练、推理、RAG和智能体工作流会形成不同的内存瓶颈,并推动更广泛的AI内存技术层级。报告强调,KV缓存密集型推理是容量、带宽和低成本内存创新的重要催化因素。
摘要
Bernstein说明,训练、推理、RAG和智能体工作流会形成不同的内存瓶颈,并推动更广泛的AI内存技术层级。报告强调,KV缓存密集型推理是容量、带宽和低成本内存创新的重要催化因素。
- 训练需要所有内存层级:HBM对带宽至关重要,DRAM、SSD和网络存储则用于数据集、暂存和检查点。
- 推理预填充受计算限制,而解码因KV缓存随token数量和并发用户数增长而受内存限制。
- 报告构建了从片上SRAM、HBM、系统内存、CXL和Storage Next,到本地SSD、CMX及共享存储的架构层级。
- HBF试图结合NAND的容量和低成本与HBM级带宽,但Bernstein认为所需性能跃升在技术上极具挑战。
- 新型架构可能在内存供应商、GPU设计商、晶圆代工厂、封装商和存储供应商之间重新分配价值。
研报解读
概览
本报告构建了理解AI内存需求及相关技术的框架。Bernstein认为,AI并不会形成单一的内存市场:工作负载和数据所在位置决定了高带宽、低延迟、容量、成本还是共享访问更重要。
核心观点
Bernstein的出发点是,AI工作负载对内存提出的要求各不相同。训练具有很高的计算强度,且常受带宽约束,因此HBM至关重要;但大型数据集必须在更慢、更便宜的存储中准备和保存,随后在复制到HBM前在更快的层级中缓存和暂存。由于训练可持续数月,系统还需要检查点以避免硬件或软件故障后从头开始。因此,报告认为系统DRAM、本地SSD和网络存储与HBM同等必要,而不是其替代品。 对于Transformer推理,报告将预填充与解码区分开来。预填充通过大规模矩阵-矩阵运算处理提示词并产生首个token;它通常受计算限制,因此加速器性能和HBM相对更重要。Bernstein将首token时间TTFT视为关键指标:聊天机器人达到约0.5秒或更低较理想,1秒可接受,超过2秒对大型任务可能仍可容忍,但在许多场景中可能引发用户挫败或放弃提示词。 解码以自回归方式生成token。为避免重复计算,前序token会作为键值对保存,使KV缓存需求随token数量线性增长。与只读的模型权重不同,KV缓存会随每个新token更新、因用户而异,并随并发用户数增加。Bernstein因此将解码定义为受内存限制:上下文长度与并发度的共同增长可使KV缓存超过模型权重,限制上下文窗口和用户容量,并最终影响AI部署规模及收入承载能力。每输出token时间TPOT是相关性能指标;报告指出,文本聊天可能可接受约50ms,即每秒20个token,而实时语音、编程和智能体等高要求应用则需低于10ms。 RAG带来不同的存储特征。数据库生成将大量文档、代码或网页处理为向量数据库和可检索索引,需要大容量存储——为缩短访问时间,SSD优于HDD——以及大量系统DRAM用于生成索引,HBM的重要性相对较低;这也是与用户数或token数无关的离线一次性工作负载。搜索时,查询向量化可快速使用HBM,但寻找最近匹配项通常使系统DRAM比HBM或SSD更重要。检索到的数据随后回到常规的预填充和解码推理流程。智能体工作流进一步放大这些需求,因为其涉及迭代式规划、工具、外部环境和中间状态保存;它也增加了CPU和传统服务器内存需求,而智能体之间传递的输出会反复形成额外的预填充、解码和KV缓存负载。 报告将这些需求组织为架构内存层级。顶层是片上或G0内存,通常为与加速器集成的SRAM,用于即时、对延迟敏感的计算。G1 HBM位于其下,与加速器共同封装以提供高带宽和低延迟。G2系统内存是由CPU管理的更高容量、但更慢的DRAM,尽管某些GPU可直接访问。CXL被归为G2.5,因为它可将物理分离的内存逻辑地组成共享池,并可从DRAM扩展到通过缓存变得更接近DRAM的NAND产品。NVIDIA的Storage Next被视为G2.6:这是一项以GPU为中心的计划,试图结合NAND的成本和容量优势以及更接近DRAM的延迟、IOPS和访问粒度,通常依靠DRAM/SRAM与NAND混合方案。 其下是G3本地SSD,可扩展节点本地容量但不能跨pod共享;以及G3.5 CMX,即NVIDIA面向KV缓存的上下文存储层。CMX兼容SSD位于数据节点中,可通过以太网、Spectrum-X交换和BlueField-4 DPU被多个计算节点访问,GPU无需CPU即可访问该层。Bernstein将STX描述为NVIDIA整合兼容CMX存储及ODM方案的参考架构。G4共享存储包括SSD、HDD或磁带,用于不在即时关键路径上的持久数据;报告称,HDD仍适合低成本、低频访问的冷数据,并受益于不断增长的数据存储和KV缓存溢出需求,而当NAND和HDD容量不足时,磁带需求也可能上升。 硬件层级说明了这些层级背后的成本、延迟和技术取舍。SRAM速度快于DRAM,但占用更多硅面积;它通常嵌入逻辑芯片作为缓存,其中L1最靠近计算单元、容量最小。嵌入式DRAM可在更大缓存中与SRAM竞争,但市场份额有限。HBM属于DRAM,并与传统DRAM共享晶圆产能;传统DRAM也可用于系统内存和CXL层。Bernstein指出,DRAM技术进步仍主要由光刻缩放驱动,并认为EUV是先进DRAM的必要条件;报告认为中国缺乏EUV将构成CXMT的长期竞争限制。报告将4F² DRAM描述为通过重新布置外围电路实现的一次性密度改进,而3D DRAM可能提供更长的扩展路径,但技术挑战更大,距离商业化仍有数年。 多项创新试图提升高性能内存,但具有不同的实施风险。Samsung的zHBM将HBM置于加速器顶部以缩短连接,但Bernstein质疑DRAM能否承受处理器热量,以及混合键合的良率和成本是否已具备商业化条件。NVIDIA的NVHBM将内存控制器功能移至NVIDIA设计的基底芯片,这可能降低加速器成本或释放芯片面积给计算单元,同时提升带宽和能效。不过,Bernstein认为这会将内存供应商基底芯片的部分差异化标准化,并将制造价值转向晶圆代工厂,最可能是TSMC。Intel的XBM被列为一种新兴的后段制程DRAM概念,可能与逻辑共存,并可能支持存内计算,但制造兼容性和最终生产者仍不确定。Intel的ZAM通过将DRAM芯片横向排列以改善散热;其实际应用目标为FY2029,重排芯片间的无线数据传输是一项挑战。Qualcomm的HBC则接受低于HBM的性能,以避免CoWoS和中介层成本,并采用LPDDR以降低功耗;Qualcomm的目标是于财年2027推出第一代、2028推出第二代。 MRDIMM、SOCAMM2和LPCAMM2等模组创新旨在提升系统内存性能。MRDIMM增加接口芯片以提高带宽;SOCAMM2采用LPDDR、128-bit总线和更低的外形高度,以降低功耗、提高每个模组的带宽,并改善AI服务器气流。PIM将逻辑与内存结合以减少数据传输这一核心计算瓶颈,但Bernstein强调其采用仍受限,因为它偏离了当前处理与内存分离的主流架构,并要求处理器、软件、网络及既有逻辑与内存供应链广泛改变。 对于存储级内存,Bernstein将其置于DRAM与NAND之间。MRAM、PCM和RRAM采用与DRAM和NAND根本不同的机制,而增强型NAND方案则通过缓存或单元模式取舍,寻求更高IOPS、更低延迟和更细访问粒度。KIOXIA的XL-FLASH采用SLC及后续MLC,支持高IOPS GP系列SSD;报告提到其性能可达今年10M IOPS及2027年的100M+。Samsung的Z-NAND/Z-SSD同样瞄准超低延迟。Bernstein将基于SLC/MLC的产品映射到Storage Next类应用,将TLC映射到兼顾性能与成本的CMX产品,将QLC映射到与HDD竞争的大容量产品。Micron的XTR SSD被列为pSLC实例,即只让部分具备TLC能力的单元存储1 bit,以获得接近SLC的耐久性和速度。 由SanDisk和SK hynix主导的HBF,是Bernstein提出的关键NAND补充HBM方案:其目标是在获得更高容量和更低每比特成本的同时实现类似HBM的带宽,并在概念上被置于G1.5层。报告强调,要实现这一目标,需要NAND跨越硬件层级中的多个级别,因此技术门槛很高。Samsung的zNAND-O则面向端侧AI,使用TLC实现大容量,并通过先进封装靠近处理器。总体而言,Bernstein的框架表明,AI增长将扩展内存和存储全栈的可服务市场,但经济收益将取决于工作负载、层级、实施可行性以及技术集成由何方获取价值。
分析框架
Bernstein先将各类主要AI工作负载与其性能瓶颈及内存需求对应,再按内存在系统中的位置构建架构层级、按存储单元结构和机制构建硬件层级。报告比较延迟、带宽、容量、成本、封装及供应链影响,以说明哪些创新可能解决各类瓶颈。
方法论与常识提炼
AI工作负载与内存层级映射
报告追踪工作负载需求如何传导至加速器、DRAM、NAND、SSD、存储、封装及供应商,以说明内存产业链不同环节为何可能受益或面临压力。
不同内存类型的性能、容量和成本权衡
报告比较高速高成本内存与低成本高容量替代方案,以解释HBF、CXL、Storage Next和存储级内存产品的逻辑。
标的映射与对比
研报将主题/逻辑映射到具体标的时的结构化摘要(优势、劣势、对比与风险)。
- Samsung Electronics (005930.KS)覆盖的内存供应商;报告讨论其zHBM、Z-NAND和CXL内存产品。
- 优势
- 在新兴AI内存层级中开发zHBM、CMM-H和Z-NAND/Z-SSD产品。
- 劣势
- Bernstein质疑zHBM的散热、混合键合良率及成本准备度。
- 对比
- 与其他HBM和DRAM供应商竞争;NVHBM可能削弱基底芯片的差异化。
- 风险
- zHBM的商业化准备度及技术扩展要求。
- SK hynix (000660.KS)覆盖的内存供应商,也是HBF的共同领导者。
- 优势
- 参与HBM,并与SanDisk共同引领HBF。
- 对比
- HBF旨在利用成本更低、容量更高的NAND补充HBM。
- 风险
- HBF要求NAND实现显著的性能跃升。
- Micron (MU)覆盖的内存供应商;报告引用其基于pSLC的XTR SSD和DRAM模组技术。
- 优势
- 参与先进DRAM及NAND SSD方案。
- 对比
- 在AI内存领域与Samsung和SK hynix竞争;NVHBM可能使基底芯片差异化标准化。
- 风险
- NVHBM下,内存供应商的价值可能转向NVIDIA和晶圆代工厂。
- KIOXIA (285A.JP)覆盖的NAND和SSD供应商;其GP系列SSD展示了Storage Next和XL-FLASH。
- 优势
- XL-FLASH支持面向存储级内存应用的高IOPS SSD产品。
- 对比
- 其基于SLC/MLC的方案瞄准更高速层级,而TLC和QLC则分别服务于CMX和容量导向型存储。
- 风险
- 产品经济性需要在容量、成本与更高性能的单元模式之间取舍。
- SanDisk (SNDK)覆盖的存储供应商,也是HBF的共同领导者。
- 优势
- 与SK hynix共同引领HBF,目标是实现比HBM更高容量和更低的每比特成本。
- 对比
- HBF定位于HBM和较低层级NAND存储之间。
- 风险
- 报告认为,实现足够的HBF性能存在很高技术门槛。
- Seagate (STX)覆盖的存储供应商,与共享存储需求相关。
- 优势
- HDD仍适用于冷数据的低成本存储,并可能承接KV缓存溢出。
- 劣势
- HDD不处于即时关键路径,且速度远低于闪存。
- 对比
- 在G4共享存储中与大容量SSD和磁带竞争。
- 风险
- 其作用取决于低成本容量需求,而非对延迟敏感的工作负载。
- Western Digital (WDC)覆盖的存储供应商,与SSD及共享存储需求相关。
- 优势
- 受益于AI数据存储需求在闪存和各存储层级的扩展。
- 对比
- 存储技术通过延迟、IOPS、耐久性、容量和成本实现差异化。
关键数据
- 理想的聊天机器人TTFT0.5 second or lowerBernstein将其列为理想的首token时间。
- 可接受的聊天机器人TTFT1 secondTTFT超过2秒可能导致用户挫败或放弃提示词。
- 文本聊天TPOT50ms, or 20 tokens per second文本聊天可能可接受的输出速度。
- 高端应用TPOTLess than 10ms适用于实时语音、编程和智能体工作负载。
- KIOXIA GP系列SSD性能Up to 10M IOPS this year and 100M+ in 2027报告以此说明基于XL-FLASH的高IOPS存储级内存定位。
- Qualcomm HBC路线图Gen-1 in fiscal 2027; Gen-2 in 2028一种使用LPDDR、以性能取舍换取更低成本的HBM替代方案。
- Intel ZAM目标FY2029该面向散热优化DRAM封装概念的实际应用既定目标。
影响与含义
报告表明,AI基础设施需求不止于HBM:解码阶段的KV缓存、RAG数据库和智能体工作流为DRAM、SSD、HDD、磁带、内存池化及新的中间层级创造需求。报告也指出,系统架构和集成选择可能在内存制造商、GPU设计商、晶圆代工厂、封装提供商和存储供应商之间重新分配价值。
风险
- HBF面临很高技术门槛,因为NAND必须实现大幅性能跃升才能补充HBM。
- zHBM在商业化生产前可能面临散热、混合键合良率和成本挑战。
- PIM采用仍受限,因为它要求处理器、软件、网络和供应链进行广泛改变。
- 3D DRAM技术挑战更大,距离商业化仍有数年。
- NVHBM可能削弱内存供应商基底芯片设计的差异化和价值获取。
后续跟踪
- 随着上下文窗口和并发用户数增加,KV缓存相对模型权重的增长。
- HBM容量能否以可承受成本扩张,或工作负载是否转向DRAM、NAND及新的中间层级。
- CXL、Storage Next、CMX和GPU直接存储方案的进展。
- HBF、zHBM、NVHBM、XBM、ZAM和HBC的商业化执行。
- XL-FLASH、Z-NAND和pSLC等高IOPS NAND技术的采用。