レポート解説
ウォール街の主要投資銀行による最新リサーチをカバー
レポート解説Hilo Research

Vertical-Die (V-die) 3.5D Integration for Ultrahigh-Bandwidth Memory Systems:V-die 3.5Dアーキテクチャは、側壁インターコネクトと直接冷却により、従来HBMのI/O、容量、冷却のボトルネックを克服する

本レポートは垂直ダイのV-dieアーキテクチャを提案し、電磁気、システム、熱の各スケールにまたがるモデルを用いて実現可能性を検証している。結果は、16-Hi HBM4と比較して、帯域幅が4.01倍、LLMデコーディング速度が81.2%向上、コンテキスト拡張時のスループット安定性が2.2倍向上、ピーク温度が43.7%低下することを示している。

日付20260803
業界Semiconductor Memory and Advanced Packaging

要約

本レポートは垂直ダイのV-dieアーキテクチャを提案し、電磁気、システム、熱の各スケールにまたがるモデルを用いて実現可能性を検証している。結果は、16-Hi HBM4と比較して、帯域幅が4.01倍、LLMデコーディング速度が81.2%向上、コンテキスト拡張時のスループット安定性が2.2倍向上、ピーク温度が43.7%低下することを示している。

—
高帯域幅メモリV-die3.5D集積先端パッケージング人工知能メモリウォール直接液冷チップレットシステム
  • V-dieはDRAMダイを垂直に配置し、側壁を介してボトムバンプへ接続することで、貫通シリコンビアの数への依存を低減する。
  • 構成比較では、ピン数は2048から8192へ増加し、理論上のメモリ帯域幅は10.24 TB/sから40.96 TB/sへ上昇する。
  • 9 mmのRDL配線はHBMの5 mm配線より長いものの、8 GbpsにおいてJEDEC HBM4受信機アイマスク規格を満たす。
  • LLMシミュレーションでは、デコーディング速度が81.2%向上し、コンテキスト長の拡大に伴うスループット安定性が2.2倍向上すると要約されている。
  • TSVを使用しないV-die DRAMは、消費電力を25%削減し、ダイ面積を回復できる。
  • 冷却液はダイ間のギャップを直接流れ、16-Hi HBM4と比較してピーク温度を43.7%低減する。

レポート解説

概要

これはAIのメモリウォール問題を扱う半導体アーキテクチャ研究である。本レポートは、チャネル当たりデータレート、スタック高さ、I/O幅に基づく従来のHBMスケーリング経路が、TSV面積、パッケージ高さ、熱蓄積によってますます制約されていると論じる。提案されるV-die 3.5D集積は、側壁I/O、ボトムバンプ、およびダイ間の直接冷却により、より大きなI/Oおよび熱の拡張性を提供する。

主要見解

本レポートはまず、AIモデルサイズの成長とGPU当たりメモリ容量の拡大速度の不一致に問題を帰している。先進Transformerモデルのパラメータ数は2年ごとに410倍に増加する一方、GPU当たりメモリは2倍にしか増加しないと説明されている。歴史的に、HBMは主にチャネル当たりデータレート、スタック高さ、I/O幅の3次元に沿ってスケーリングしてきた。レポートで示される世代推移は、HBM1(2014)からHBM2(2018)、HBM2E(2020)、HBM3(2022)、HBM3E(2024)、HBM4(2026)に及び、スタックは4-Hiから12-Hi/16-Hiへ、チャネル当たりレートは1 Gbpsから8 Gbpsへ、I/O数は1024から2048へ進展している。しかし、このスケーリング手法は物理的制約をますます受けている。 第1の制約は、TSVが使用可能なDRAM面積を占有するため、その数を無制限に増やせないことである。第2はZ軸方向のパッケージ高さである。表によると、HBM1/HBM2、HBM3、HBM4の典型的な総高さはそれぞれ約720、720、775マイクロメートルであり、8-Hi、12-Hi、16-Hi構成の典型的な層当たり厚さはそれぞれ約90、60、48.4マイクロメートルである。固定された高さ制約の下で層数を増やすには、より薄いダイが必要となり、歩留まりに影響し、熱密度を高める可能性がある。第3の制約は垂直方向の熱経路である。ボトムダイの熱は、複数層のBEOL、マイクロバンプ、アンダーフィル、および潜在的なマイクロボイドを通過しなければならない。熱抵抗は層ごとに蓄積し、顕著な温度勾配と冷却ボトルネックを生む。 V-die設計はDRAMダイを垂直に配置し、側壁I/Oパッドとボトムバンプを介して相互接続を実現する。この構造では、I/Oスケーリングがダイ内のTSVのみによって完全に制約されなくなり、ダイ間のギャップは冷却液がアクセス可能な表面積を増加させる。16-Hi構成において、このレイアウトはより強いI/O拡張性を提供するとレポートは主張するが、その代償としてRDLをすべてのダイまで延長する必要がある。最長の配線経路は約9 mmであり、従来HBMの約5 mmと比較して、追加の挿入損失、反射、クロストークが許容範囲に収まるかを検証する必要がある。 電気的検証では、40 GHz、50オーム整合コプレーナ導波路からのSパラメータ測定を用いて電磁気シミュレーションを較正している。抽出された比誘電率は6.5、損失正接は0.002、銅の導電率は3×10^7 S/mである。RDLは、上下のグランドプレーン間の二酸化シリコンに埋め込まれた銅信号トレースとしてモデル化されている。結果は、最大レート8 Gbpsにおいて、V-dieのパッシブチャネル特性が概ねHBMと同等であることを示す。より長いトレースは挿入損失を増加させるが、リターンロスは同程度に保たれ、近端および遠端クロストークはいずれも全周波数範囲で−30 dB未満にとどまる。8 Gbpsにおいて、V-dieチャネルは0.3 UIおよび100 mVというJEDEC HBM4受信機アイマスク要件を満たすが、そのアイマージンはHBMよりわずかに小さい。 システムレベル分析では、電磁気的に検証されたパラメータをJEDECタイミングベースのメモリモデルに組み込み、gem5を用いて合成トラフィックシミュレーションを実施する。両比較構成は16メモリスタックおよび8.0 Gbpsのピンレートを使用する。構成表では、スタック当たりピン数は2048から8192へ、メモリ帯域幅は10.24 TB/sから40.96 TB/sへ増加し、キャッシュ側がメモリI/O能力を覆い隠さないよう、L2キャッシュ帯域幅も24.0 TB/sから96.0 TB/sへ対応して増加している。これらの結果に基づき、レポートは最終的にV-dieが4.01倍高い帯域幅を実現できると結論付けている。 アプリケーションレベルでは、LLMCompassを用いてA100モデルと、本研究のために新たに構築されたH100モデルを評価している。ワークロードは、1,750億パラメータ、96層、96アテンションヘッド、隠れ次元12288のモデルである。レポートはトークン生成レートと演算レベルのレイテンシを用いて推論デコーディング性能を測定し、V-dieがデコーディング速度を81.2%向上させると結論付けている。コンテキスト拡張テストでは、結果ページは24.8%の速度低下を示す一方、レポートはV-dieが参照設計より2.2倍大きいスループット安定性を提供すると結論付けており、より高く安定したメモリ帯域幅が長コンテキスト推論におけるメモリボトルネックを緩和できることを示している。 電力および熱解析では、V-dieのスケーリング上の利点をさらに説明している。HBM4のベースダイは、PHY用6 WとTSV用3 Wからなる9 Wを消費する。各HBM4 DRAMダイは、TSVオーバーヘッドを含めて約2 Wを消費する。V-die DRAMはTSVを排除しており、レポートによれば、これによりダイ面積を確保しつつ消費電力を25%削減できる。従来のHBM4はトップコールドプレートに依存するため、熱はスタック全体を通過する必要がある。一方、V-dieでは冷却液がダイ間のギャップを直接流れることができ、各ダイで発生する熱を局所的に吸収できる。ダイ間の冷却液は実質的に熱グランドプレーンとして機能する。周囲温度45°Cという同一条件下で、V-dieのピーク温度はHBM4より低く、ダイ間の顕著な温度勾配を解消する。最終結果は、16-Hi HBM4と比較してピーク温度を43.7%低減することである。 したがって、本レポートは、V-dieが垂直配線と直接冷却を通じてI/O、容量、熱のスケーリング制約を同時に緩和し、電磁気、システム、アプリケーション、熱の各スケールにまたがる共同モデリングが、このアーキテクチャがLLM性能の改善に結び付くかを判断するうえで重要であると結論付けている。本研究はまた、チップレットとヘテロジニアス集積の時代におけるシステムシミュレーションでは、公称帯域幅のみからアプリケーション性能を推定するのではなく、領域横断的な物理制約を組み込む必要があることを強調している。

分析フレームワーク

本研究は、問題定義、アーキテクチャ設計、物理的検証、システムシミュレーション、アプリケーション試験、熱検証の順序で進められる。まず世代別HBM仕様を用いてTSV、パッケージ高さ、熱経路が課す制約を説明し、次に側壁インターコネクトとダイ間冷却を特徴とするV-die設計を提案する。その後、測定で較正した電磁気モデルを使用してRDL信号完全性を評価し、検証済みパラメータをgem5の合成トラフィックモデルおよびLLMCompassのワークロードモデルに投入し、最後にパワーマップと熱抵抗ネットワークを用いてHBM4とV-dieの熱性能を比較する。

手法メモ

  • その他その他

    クロススケール共同検証フレームワーク

    本レポートは、物理層の電磁気および熱制約をシステムおよびLLMアプリケーションモデルへ段階的に反映し、アーキテクチャ変更が帯域幅、レイテンシ、デコーディングスループットの実際の改善につながるかを判断する。

  • その他その他

    Sパラメータ測定により較正された電磁気シミュレーション

    本研究は、40 GHz、50オームのコプレーナ導波路測定を使用して誘電率、損失、銅導電率を抽出し、これらのパラメータを用いて、より長いRDLトレースの挿入損失、反射、クロストーク、アイダイアグラムをシミュレーションする。

  • その他その他

    合成トラフィックおよびLLMワークロードシミュレーション

    本研究はまずgem5とJEDECタイミングモデルを使用してトラフィック負荷下の帯域幅とレイテンシを試験し、次にLLMCompassを用いて1,750億パラメータモデルのトークン生成レートと演算レベルのレイテンシを評価する。

  • その他その他

    熱抵抗ネットワーク解析

    本レポートは、トップコールドプレートと直接ダイ間冷却の熱伝導経路を比較し、異なるダイ層にわたる総熱抵抗、ピーク温度、温度勾配を分析する。

主要データ

  • モデルパラメータ成長とGPUメモリスケーリング410-fold every two years; 2-fold for memory per GPUAIシステムのメモリウォールの根底にある成長の不一致を示すためにレポートで使用されている
  • HBM世代の範囲HBM1 (2014) to HBM4 (2026)スタックは4-Hiから12-Hi/16-Hiへ拡張し、チャネル当たりレートは1 Gbpsから8 Gbpsへ上昇する
  • 典型的な層当たりダイ厚90 micrometers, 60 micrometers, 48.4 micrometersそれぞれ8-Hi、12-Hi、16-Hi構成に対応し、固定パッケージ高さ制約下でダイを薄くする圧力を示している
  • RDL経路長V-die 9 mm, HBM 5 mmV-dieのより長い配線は挿入損失を増加させるが、リターンロスは同程度に保たれる
  • 電磁気モデルの較正40 GHz, 50 ohmsコプレーナ導波路のSパラメータ測定とシミュレーションを相関させることで材料パラメータを抽出する
  • 抽出された材料パラメータεr=6.5, tanδ=0.002, copper conductivity=3×10^7 S/m高忠実度RDL配線シミュレーションに使用される
  • クロストークレベルBoth NEXT and FEXT below −30 dB分析された全周波数範囲にわたる
  • アイダイアグラム適合性8 Gbps; 0.3 UI, 100 mVV-dieはJEDEC HBM4受信機アイマスクを満たすが、そのマージンはHBMよりわずかに小さい
  • スタック当たりピン数Increased from 2048 to 8192HBM4とV-dieの比較構成
  • メモリ帯域幅Increased from 10.24 TB/s to 40.96 TB/s構成値;レポートは実際の帯域幅が4.01倍向上すると結論付けている
  • L2キャッシュ帯域幅Increased from 24.0 TB/s to 96.0 TB/sキャッシュ側がメモリI/O能力を覆い隠さないよう引き上げられた
  • LLMワークロード175 billion parameters, 96 layers, 96 attention heads, hidden dimension of 12288トークン生成レートと演算レベルのレイテンシのシミュレーションに使用される
  • LLMデコーディング性能81.2% fasterV-dieの相対性能に関するレポートの要約
  • コンテキスト拡張時の安定性2.2 timesスループット安定性におけるレポートの要約された改善;結果ページでは24.8%の速度低下も示されている
  • HBM4ベースダイ消費電力9 WPHY用6 W、TSV用3 W
  • ダイ当たりHBM4 DRAM消費電力Approximately 2 WTSVオーバーヘッドを含む
  • V-die DRAMの消費電力削減25%TSVの排除によるものであり、同時にダイ面積も回復する
  • ピーク温度の改善Reduced by 43.7%同じ周囲温度45°Cの下で16-Hi HBM4と比較

影響と示唆

本レポートは、側壁I/Oと直接ダイ間冷却が検証どおりに実装できれば、V-dieは、より多くのTSVとより薄いダイに依存する従来のHBMスケーリング経路を回避し、面積、消費電力、熱密度を同等に増加させずに、より高い容量とより広いI/Oを可能にすると論じている。AIシステムにとって、これらの改善はより高いLLMデコーディングスループットと、長コンテキストワークロードにおけるより大きな性能安定性につながる可能性がある。本研究はまた、新規チップレットアーキテクチャが電磁気、熱、アプリケーション層にまたがる共同モデルを使用して検証されなければならないことを示している。

リスク

  • V-dieは、各層のダイを接続するため、最大約9 mm長のRDL接続を使用する必要がある。HBMの約5 mmの経路と比べて、これはより高い挿入損失とわずかに低下したアイダイアグラムマージンをもたらす。
  • このアーキテクチャには、電気、タイミング、容量、熱の制約が密接に結合している。レポートは、領域横断的な評価が必要であり、単一層における公称性能だけではシステムの実現可能性を示すには不十分であると明示している。

注目点

  • V-dieパッケージングのロードマップに沿ったインターコネクト、製造、冷却構造のさらなる技術進展。
  • クロススケール検証フレームワークを、チップレットベースのヘテロジニアス集積システムおよび再利用可能なLLMワークロードモジュールへ拡張できるか。

設定

最近のログインを表示するにはログインしてください