面向超高带宽内存系统的垂直芯片(V-die)3.5D集成:V-die 3.5D架构以侧壁互连和直接冷却突破传统HBM的I/O、容量与散热瓶颈
报告提出垂直芯片V-die架构,并以跨电磁、系统和热学尺度的模型验证其可行性。研究结果显示,其带宽提高4.01倍、LLM解码速度提升81.2%、上下文扩展下的吞吐稳定性提高2.2倍,峰值温度较16-Hi HBM4降低43.7%。
摘要
报告提出垂直芯片V-die架构,并以跨电磁、系统和热学尺度的模型验证其可行性。研究结果显示,其带宽提高4.01倍、LLM解码速度提升81.2%、上下文扩展下的吞吐稳定性提高2.2倍,峰值温度较16-Hi HBM4降低43.7%。
- V-die通过垂直放置DRAM芯片并从侧壁连接底部凸点,降低对贯穿硅通孔数量的依赖。
- 配置对比显示,引脚数由2048增至8192,理论内存带宽由10.24 TB/s增至40.96 TB/s。
- 9毫米RDL布线虽长于HBM的5毫米,但在8 Gbps下仍满足JEDEC HBM4接收端眼图标准。
- LLM模拟总结为解码速度提升81.2%,上下文扩展时的吞吐稳定性提高2.2倍。
- 无TSV的V-die DRAM可节省25%功耗并回收芯片面积。
- 冷却液直接流经芯片间隙,使峰值温度较16-Hi HBM4降低43.7%。
研报解读
概览
这是一项面向AI内存墙问题的半导体架构研究。报告认为,传统HBM沿单通道速率、堆叠高度和I/O宽度扩展的路径正受到TSV面积、封装高度及热累积约束;所提出的V-die 3.5D集成通过侧壁I/O、底部凸点和芯片间直接冷却,提供更高的I/O与热扩展能力。
核心观点
报告首先将问题归结为AI模型规模与单GPU内存扩展速度的不匹配:先进Transformer模型的参数量被描述为每两年增长410倍,而单GPU内存仅增长2倍。HBM过去主要从单通道数据率、堆叠高度和I/O宽度三个方向扩展。报告列示的代际路径覆盖HBM1(2014年)、HBM2(2018年)、HBM2E(2020年)、HBM3(2022年)、HBM3E(2024年)和HBM4(2026年),堆叠由4-Hi逐步走向12-Hi/16-Hi,单通道速率由1 Gbps升至8 Gbps,I/O数量由1024增至2048;但这种扩展越来越受到物理限制。 第一项限制是TSV占用DRAM有效面积,数量无法无限增加。第二项是封装Z向高度:表中HBM1/HBM2、HBM3和HBM4的典型总高度分别约为720、720和775微米,而8-Hi、12-Hi和16-Hi对应的典型单层厚度约为90、60和48.4微米;在高度约束下继续增加层数,需要把芯片做得更薄,进而影响良率并提高热密度。第三项是垂直热路径,底部芯片的热量需要穿过多层BEOL、微凸点、底填胶及潜在微空洞,热阻逐层累积,形成明显的温度梯度和散热瓶颈。 V-die方案将DRAM芯片垂直排列,以侧壁I/O焊盘和底部凸点实现互连。该结构不再让I/O扩展完全受限于芯片内部TSV,并通过芯片间隙增加可接触冷却液的表面积。16-Hi配置下,报告认为这种布局能够提供更强的I/O扩展性,但代价是RDL必须延伸至每一颗芯片,最长布线路径约为9毫米,而传统HBM约为5毫米,因此需要验证额外插入损耗、反射和串扰是否可接受。 电气验证以40 GHz、50欧姆匹配共面波导的S参数测量校准电磁仿真,提取的相对介电常数为6.5、损耗角正切为0.002、铜电导率为3×10^7 S/m。RDL被建模为上下接地平面之间、位于二氧化硅中的铜信号线。结果显示,在最高8 Gbps时,V-die的无源通道特征总体可与HBM匹配;较长走线增加了插入损耗,但反射损耗仍然相近,近端和远端串扰在整个频率范围内均低于−30 dB。在8 Gbps下,V-die通道满足JEDEC HBM4接收端0.3 UI、100 mV眼图掩模要求,不过眼图余量略低于HBM。 系统层分析把电磁验证后的参数带入基于JEDEC时序的内存模型,并通过gem5进行合成流量仿真。对比配置均采用16个内存堆栈、8.0 Gbps引脚速率;配置表显示每堆栈引脚数由2048增加至8192,内存带宽由10.24 TB/s增加至40.96 TB/s,L2缓存带宽由24.0 TB/s相应提高至96.0 TB/s,以避免缓存侧掩盖内存I/O能力。由此,报告最终总结V-die可实现4.01倍更高的带宽。 应用层使用LLMCompass评估A100模型和本研究新构建的H100模型,工作负载为1750亿参数模型,包含96层、96个注意力头和12288维隐藏层。报告以令牌生成速率和操作级延迟衡量推理解码表现,结论是V-die带来81.2%的解码速度提升。上下文扩展测试中,结果页标示24.8%的速度下降,同时报告总结V-die相对于对照方案具有2.2倍更高的吞吐稳定性,说明更高且更稳定的内存带宽可缓解长上下文推理中的内存瓶颈。 功耗与热分析进一步解释了V-die的扩展优势。HBM4基底芯片功耗为9 W,其中PHY为6 W、TSV为3 W;每颗HBM4 DRAM芯片约消耗2 W并包含TSV开销。V-die DRAM取消TSV,报告称可节省25%功耗并释放芯片面积。传统HBM4依靠顶部冷板,热量必须穿过整个堆叠;V-die则允许冷却液直接流过芯片间隙,使每颗芯片产生的热量就近被吸收,芯片间冷却液相当于热接地面。在环境温度45°C的相同条件下,V-die峰值温度低于HBM4,消除了明显的芯片间温度梯度;最终结果为峰值温度较16-Hi HBM4降低43.7%。 报告因此认为,V-die以垂直布线和直接冷却同时缓解I/O、容量与热扩展约束,而跨电磁、系统、应用及热学尺度的联合建模是判断该架构能否转化为LLM性能提升的关键。研究也强调,芯粒和异构集成时代的系统仿真必须纳入跨领域物理约束,不能只根据名义带宽推断应用性能。
分析框架
研究按“问题界定—架构设计—物理验证—系统仿真—应用测试—热学验证”的顺序展开。先用HBM代际规格说明TSV、封装高度和热路径限制,再提出V-die侧壁互连与芯片间冷却方案;随后通过测量校准的电磁模型检查RDL信号完整性,把验证后的参数输入gem5合成流量模型和LLMCompass工作负载模型,最后以功耗图和热阻网络比较HBM4与V-die的温度表现。
方法论与常识提炼
跨尺度联合验证框架
报告把物理层的电磁与热约束逐级传递到系统和LLM应用模型,用于判断架构层改动能否形成实际带宽、延迟和解码吞吐改善。
基于S参数测量校准的电磁仿真
研究使用40 GHz、50欧姆共面波导测量提取介电常数、损耗和铜电导率,再据此模拟较长RDL线路的插入损耗、反射、串扰和眼图。
合成流量与LLM工作负载仿真
研究先用gem5和JEDEC时序模型测试受流量负载影响的带宽与延迟,再用LLMCompass评估1750亿参数模型的令牌生成率和操作级延迟。
热阻网络分析
报告比较顶部冷板与芯片间直接冷却的热传导路径,分析总热阻、峰值温度和不同芯片层之间的温度梯度。
关键数据
- 模型参数增长与GPU内存扩展每两年410倍,单GPU内存2倍报告用于说明AI系统内存墙的增长失配
- HBM代际跨度HBM1(2014年)至HBM4(2026年)堆叠由4-Hi扩展至12-Hi/16-Hi,单通道速率由1 Gbps升至8 Gbps
- 典型单层芯片厚度90微米、60微米、48.4微米分别对应8-Hi、12-Hi和16-Hi配置,显示固定封装高度下的减薄压力
- RDL路径长度V-die 9毫米,HBM 5毫米V-die较长布线增加插入损耗,但反射损耗仍相近
- 电磁模型校准40 GHz、50欧姆通过共面波导S参数测量与仿真相关性提取材料参数
- 提取材料参数εr=6.5,tanδ=0.002,铜电导率=3×10^7 S/m用于高保真RDL布线仿真
- 串扰水平NEXT和FEXT均低于−30 dB覆盖整个分析频率范围
- 眼图合规性8 Gbps;0.3 UI、100 mVV-die满足JEDEC HBM4接收端眼图掩模,但余量略低于HBM
- 每堆栈引脚数2048增至8192HBM4与V-die对比配置
- 内存带宽10.24 TB/s增至40.96 TB/s配置值;报告总结实际带宽提升4.01倍
- L2缓存带宽24.0 TB/s增至96.0 TB/s为避免缓存侧掩盖内存I/O能力而提高
- LLM工作负载1750亿参数、96层、96个注意力头、12288维隐藏层用于令牌生成率和操作级延迟模拟
- LLM解码性能快81.2%报告对V-die相对性能的总结
- 上下文扩展稳定性2.2倍报告总结的吞吐稳定性提升;结果页同时标示24.8%的速度下降
- HBM4基底芯片功耗9 WPHY为6 W,TSV为3 W
- HBM4 DRAM单芯片功耗约2 W包含TSV开销
- V-die DRAM功耗节省25%源于取消TSV,同时可回收芯片面积
- 峰值温度改善降低43.7%相较16-Hi HBM4;同条件环境温度为45°C
影响与含义
报告认为,若侧壁I/O和直接芯片间冷却能够按验证结果落地,V-die可绕开传统HBM依赖更多TSV和更薄芯片的扩展路径,使更高容量与更宽I/O不必以同等程度的面积、功耗和热密度代价换取。对AI系统而言,这种改善可传导至更高的LLM解码吞吐和更强的长上下文性能稳定性;同时,研究表明新型芯粒架构必须以跨电磁、热学和应用层的联合模型验证。
风险
- V-die必须使用最长约9毫米的RDL连接各层芯片,较HBM约5毫米的路径带来更高插入损耗,并使眼图余量略有下降。
- 该架构存在紧密耦合的电气、时序、容量和热学约束,报告明确指出必须进行跨领域评估,单一层面的名义性能不足以证明系统可行性。
后续跟踪
- V-die封装路线图后续在互连、制造与冷却结构方面的技术推进。
- 跨尺度验证框架能否进一步覆盖芯粒异构集成系统及可复用的LLM工作负载模块。