研报解读
覆盖华尔街顶级投行最新研报
研报解读河洛投研

Global AI memory研报解读

Bernstein说明,训练、推理、RAG和智能体工作流会形成不同的内存瓶颈,并推动更广泛的AI内存技术层级。报告强调,KV缓存密集型推理是容量、带宽和低成本内存创新的重要催化因素。

机构Bernstein
日期20260828
行业AI memory and semiconductor memory

摘要

Bernstein说明,训练、推理、RAG和智能体工作流会形成不同的内存瓶颈,并推动更广泛的AI内存技术层级。报告强调,KV缓存密集型推理是容量、带宽和低成本内存创新的重要催化因素。

Samsung Electronics、SK hynix、Micron、SanDisk、Seagate和Western Digital:Outperform;KIOXIA:Underperform。
AI内存HBMDRAMNANDKV缓存AI推理CXLStorage NextHBF半导体
  • 训练需要所有内存层级:HBM对带宽至关重要,DRAM、SSD和网络存储则用于数据集、暂存和检查点。
  • 推理预填充受计算限制,而解码因KV缓存随token数量和并发用户数增长而受内存限制。
  • 报告构建了从片上SRAM、HBM、系统内存、CXL和Storage Next,到本地SSD、CMX及共享存储的架构层级。
  • HBF试图结合NAND的容量和低成本与HBM级带宽,但Bernstein认为所需性能跃升在技术上极具挑战。
  • 新型架构可能在内存供应商、GPU设计商、晶圆代工厂、封装商和存储供应商之间重新分配价值。

研报解读

概览

本报告构建了理解AI内存需求及相关技术的框架。Bernstein认为,AI并不会形成单一的内存市场:工作负载和数据所在位置决定了高带宽、低延迟、容量、成本还是共享访问更重要。

核心观点

Bernstein的出发点是,AI工作负载对内存提出的要求各不相同。训练具有很高的计算强度,且常受带宽约束,因此HBM至关重要;但大型数据集必须在更慢、更便宜的存储中准备和保存,随后在复制到HBM前在更快的层级中缓存和暂存。由于训练可持续数月,系统还需要检查点以避免硬件或软件故障后从头开始。因此,报告认为系统DRAM、本地SSD和网络存储与HBM同等必要,而不是其替代品。 对于Transformer推理,报告将预填充与解码区分开来。预填充通过大规模矩阵-矩阵运算处理提示词并产生首个token;它通常受计算限制,因此加速器性能和HBM相对更重要。Bernstein将首token时间TTFT视为关键指标:聊天机器人达到约0.5秒或更低较理想,1秒可接受,超过2秒对大型任务可能仍可容忍,但在许多场景中可能引发用户挫败或放弃提示词。 解码以自回归方式生成token。为避免重复计算,前序token会作为键值对保存,使KV缓存需求随token数量线性增长。与只读的模型权重不同,KV缓存会随每个新token更新、因用户而异,并随并发用户数增加。Bernstein因此将解码定义为受内存限制:上下文长度与并发度的共同增长可使KV缓存超过模型权重,限制上下文窗口和用户容量,并最终影响AI部署规模及收入承载能力。每输出token时间TPOT是相关性能指标;报告指出,文本聊天可能可接受约50ms,即每秒20个token,而实时语音、编程和智能体等高要求应用则需低于10ms。 RAG带来不同的存储特征。数据库生成将大量文档、代码或网页处理为向量数据库和可检索索引,需要大容量存储——为缩短访问时间,SSD优于HDD——以及大量系统DRAM用于生成索引,HBM的重要性相对较低;这也是与用户数或token数无关的离线一次性工作负载。搜索时,查询向量化可快速使用HBM,但寻找最近匹配项通常使系统DRAM比HBM或SSD更重要。检索到的数据随后回到常规的预填充和解码推理流程。智能体工作流进一步放大这些需求,因为其涉及迭代式规划、工具、外部环境和中间状态保存;它也增加了CPU和传统服务器内存需求,而智能体之间传递的输出会反复形成额外的预填充、解码和KV缓存负载。 报告将这些需求组织为架构内存层级。顶层是片上或G0内存,通常为与加速器集成的SRAM,用于即时、对延迟敏感的计算。G1 HBM位于其下,与加速器共同封装以提供高带宽和低延迟。G2系统内存是由CPU管理的更高容量、但更慢的DRAM,尽管某些GPU可直接访问。CXL被归为G2.5,因为它可将物理分离的内存逻辑地组成共享池,并可从DRAM扩展到通过缓存变得更接近DRAM的NAND产品。NVIDIA的Storage Next被视为G2.6:这是一项以GPU为中心的计划,试图结合NAND的成本和容量优势以及更接近DRAM的延迟、IOPS和访问粒度,通常依靠DRAM/SRAM与NAND混合方案。 其下是G3本地SSD,可扩展节点本地容量但不能跨pod共享;以及G3.5 CMX,即NVIDIA面向KV缓存的上下文存储层。CMX兼容SSD位于数据节点中,可通过以太网、Spectrum-X交换和BlueField-4 DPU被多个计算节点访问,GPU无需CPU即可访问该层。Bernstein将STX描述为NVIDIA整合兼容CMX存储及ODM方案的参考架构。G4共享存储包括SSD、HDD或磁带,用于不在即时关键路径上的持久数据;报告称,HDD仍适合低成本、低频访问的冷数据,并受益于不断增长的数据存储和KV缓存溢出需求,而当NAND和HDD容量不足时,磁带需求也可能上升。 硬件层级说明了这些层级背后的成本、延迟和技术取舍。SRAM速度快于DRAM,但占用更多硅面积;它通常嵌入逻辑芯片作为缓存,其中L1最靠近计算单元、容量最小。嵌入式DRAM可在更大缓存中与SRAM竞争,但市场份额有限。HBM属于DRAM,并与传统DRAM共享晶圆产能;传统DRAM也可用于系统内存和CXL层。Bernstein指出,DRAM技术进步仍主要由光刻缩放驱动,并认为EUV是先进DRAM的必要条件;报告认为中国缺乏EUV将构成CXMT的长期竞争限制。报告将4F² DRAM描述为通过重新布置外围电路实现的一次性密度改进,而3D DRAM可能提供更长的扩展路径,但技术挑战更大,距离商业化仍有数年。 多项创新试图提升高性能内存,但具有不同的实施风险。Samsung的zHBM将HBM置于加速器顶部以缩短连接,但Bernstein质疑DRAM能否承受处理器热量,以及混合键合的良率和成本是否已具备商业化条件。NVIDIA的NVHBM将内存控制器功能移至NVIDIA设计的基底芯片,这可能降低加速器成本或释放芯片面积给计算单元,同时提升带宽和能效。不过,Bernstein认为这会将内存供应商基底芯片的部分差异化标准化,并将制造价值转向晶圆代工厂,最可能是TSMC。Intel的XBM被列为一种新兴的后段制程DRAM概念,可能与逻辑共存,并可能支持存内计算,但制造兼容性和最终生产者仍不确定。Intel的ZAM通过将DRAM芯片横向排列以改善散热;其实际应用目标为FY2029,重排芯片间的无线数据传输是一项挑战。Qualcomm的HBC则接受低于HBM的性能,以避免CoWoS和中介层成本,并采用LPDDR以降低功耗;Qualcomm的目标是于财年2027推出第一代、2028推出第二代。 MRDIMM、SOCAMM2和LPCAMM2等模组创新旨在提升系统内存性能。MRDIMM增加接口芯片以提高带宽;SOCAMM2采用LPDDR、128-bit总线和更低的外形高度,以降低功耗、提高每个模组的带宽,并改善AI服务器气流。PIM将逻辑与内存结合以减少数据传输这一核心计算瓶颈,但Bernstein强调其采用仍受限,因为它偏离了当前处理与内存分离的主流架构,并要求处理器、软件、网络及既有逻辑与内存供应链广泛改变。 对于存储级内存,Bernstein将其置于DRAM与NAND之间。MRAM、PCM和RRAM采用与DRAM和NAND根本不同的机制,而增强型NAND方案则通过缓存或单元模式取舍,寻求更高IOPS、更低延迟和更细访问粒度。KIOXIA的XL-FLASH采用SLC及后续MLC,支持高IOPS GP系列SSD;报告提到其性能可达今年10M IOPS及2027年的100M+。Samsung的Z-NAND/Z-SSD同样瞄准超低延迟。Bernstein将基于SLC/MLC的产品映射到Storage Next类应用,将TLC映射到兼顾性能与成本的CMX产品,将QLC映射到与HDD竞争的大容量产品。Micron的XTR SSD被列为pSLC实例,即只让部分具备TLC能力的单元存储1 bit,以获得接近SLC的耐久性和速度。 由SanDisk和SK hynix主导的HBF,是Bernstein提出的关键NAND补充HBM方案:其目标是在获得更高容量和更低每比特成本的同时实现类似HBM的带宽,并在概念上被置于G1.5层。报告强调,要实现这一目标,需要NAND跨越硬件层级中的多个级别,因此技术门槛很高。Samsung的zNAND-O则面向端侧AI,使用TLC实现大容量,并通过先进封装靠近处理器。总体而言,Bernstein的框架表明,AI增长将扩展内存和存储全栈的可服务市场,但经济收益将取决于工作负载、层级、实施可行性以及技术集成由何方获取价值。

分析框架

Bernstein先将各类主要AI工作负载与其性能瓶颈及内存需求对应,再按内存在系统中的位置构建架构层级、按存储单元结构和机制构建硬件层级。报告比较延迟、带宽、容量、成本、封装及供应链影响,以说明哪些创新可能解决各类瓶颈。

方法论与常识提炼

  • 行业/产业分析框架产业链上中下游传导

    AI工作负载与内存层级映射

    报告追踪工作负载需求如何传导至加速器、DRAM、NAND、SSD、存储、封装及供应商,以说明内存产业链不同环节为何可能受益或面临压力。

  • 行业/产业分析框架成本曲线分析

    不同内存类型的性能、容量和成本权衡

    报告比较高速高成本内存与低成本高容量替代方案,以解释HBF、CXL、Storage Next和存储级内存产品的逻辑。

标的映射与对比

研报将主题/逻辑映射到具体标的时的结构化摘要(优势、劣势、对比与风险)。

  • Samsung Electronics (005930.KS)
    覆盖的内存供应商;报告讨论其zHBM、Z-NAND和CXL内存产品。
    优势
    在新兴AI内存层级中开发zHBM、CMM-H和Z-NAND/Z-SSD产品。
    劣势
    Bernstein质疑zHBM的散热、混合键合良率及成本准备度。
    对比
    与其他HBM和DRAM供应商竞争;NVHBM可能削弱基底芯片的差异化。
    风险
    zHBM的商业化准备度及技术扩展要求。
  • SK hynix (000660.KS)
    覆盖的内存供应商,也是HBF的共同领导者。
    优势
    参与HBM,并与SanDisk共同引领HBF。
    对比
    HBF旨在利用成本更低、容量更高的NAND补充HBM。
    风险
    HBF要求NAND实现显著的性能跃升。
  • Micron (MU)
    覆盖的内存供应商;报告引用其基于pSLC的XTR SSD和DRAM模组技术。
    优势
    参与先进DRAM及NAND SSD方案。
    对比
    在AI内存领域与Samsung和SK hynix竞争;NVHBM可能使基底芯片差异化标准化。
    风险
    NVHBM下,内存供应商的价值可能转向NVIDIA和晶圆代工厂。
  • KIOXIA (285A.JP)
    覆盖的NAND和SSD供应商;其GP系列SSD展示了Storage Next和XL-FLASH。
    优势
    XL-FLASH支持面向存储级内存应用的高IOPS SSD产品。
    对比
    其基于SLC/MLC的方案瞄准更高速层级,而TLC和QLC则分别服务于CMX和容量导向型存储。
    风险
    产品经济性需要在容量、成本与更高性能的单元模式之间取舍。
  • SanDisk (SNDK)
    覆盖的存储供应商,也是HBF的共同领导者。
    优势
    与SK hynix共同引领HBF,目标是实现比HBM更高容量和更低的每比特成本。
    对比
    HBF定位于HBM和较低层级NAND存储之间。
    风险
    报告认为,实现足够的HBF性能存在很高技术门槛。
  • Seagate (STX)
    覆盖的存储供应商,与共享存储需求相关。
    优势
    HDD仍适用于冷数据的低成本存储,并可能承接KV缓存溢出。
    劣势
    HDD不处于即时关键路径,且速度远低于闪存。
    对比
    在G4共享存储中与大容量SSD和磁带竞争。
    风险
    其作用取决于低成本容量需求,而非对延迟敏感的工作负载。
  • Western Digital (WDC)
    覆盖的存储供应商,与SSD及共享存储需求相关。
    优势
    受益于AI数据存储需求在闪存和各存储层级的扩展。
    对比
    存储技术通过延迟、IOPS、耐久性、容量和成本实现差异化。

关键数据

  • 理想的聊天机器人TTFT0.5 second or lowerBernstein将其列为理想的首token时间。
  • 可接受的聊天机器人TTFT1 secondTTFT超过2秒可能导致用户挫败或放弃提示词。
  • 文本聊天TPOT50ms, or 20 tokens per second文本聊天可能可接受的输出速度。
  • 高端应用TPOTLess than 10ms适用于实时语音、编程和智能体工作负载。
  • KIOXIA GP系列SSD性能Up to 10M IOPS this year and 100M+ in 2027报告以此说明基于XL-FLASH的高IOPS存储级内存定位。
  • Qualcomm HBC路线图Gen-1 in fiscal 2027; Gen-2 in 2028一种使用LPDDR、以性能取舍换取更低成本的HBM替代方案。
  • Intel ZAM目标FY2029该面向散热优化DRAM封装概念的实际应用既定目标。

影响与含义

报告表明,AI基础设施需求不止于HBM:解码阶段的KV缓存、RAG数据库和智能体工作流为DRAM、SSD、HDD、磁带、内存池化及新的中间层级创造需求。报告也指出,系统架构和集成选择可能在内存制造商、GPU设计商、晶圆代工厂、封装提供商和存储供应商之间重新分配价值。

风险

  • HBF面临很高技术门槛,因为NAND必须实现大幅性能跃升才能补充HBM。
  • zHBM在商业化生产前可能面临散热、混合键合良率和成本挑战。
  • PIM采用仍受限,因为它要求处理器、软件、网络和供应链进行广泛改变。
  • 3D DRAM技术挑战更大,距离商业化仍有数年。
  • NVHBM可能削弱内存供应商基底芯片设计的差异化和价值获取。

后续跟踪

  • 随着上下文窗口和并发用户数增加,KV缓存相对模型权重的增长。
  • HBM容量能否以可承受成本扩张,或工作负载是否转向DRAM、NAND及新的中间层级。
  • CXL、Storage Next、CMX和GPU直接存储方案的进展。
  • HBF、zHBM、NVHBM、XBM、ZAM和HBC的商业化执行。
  • XL-FLASH、Z-NAND和pSLC等高IOPS NAND技术的采用。
备案号:浙ICP备2022035445号-5
免责声明:本网站提供的市场数据、图表、指标、研究观点及其他信息,仅用于信息展示、研究交流与学习参考,不应被视为任何形式的个性化投资建议、证券推荐、交易指令、要约邀请或收益承诺。尽管我们尽力提升数据与内容的可靠性,相关信息仍可能因来源差异、统计口径、系统处理或市场波动而存在延迟、误差、不完整或更新不及时的情况。用户在使用本网站任何内容时,应结合自身情况进行独立判断,并自行承担由此产生的风险与责任。

设置

登录后可查看最近记录