半導体メモリおよびAIコンピューティング・アーキテクチャ:HBMベースダイは、インターフェース層から制御・拡張・ニアメモリコンピューティングのためのAIシステムプラットフォームへ進化する
本レポートは3段階の進化ロードマップを提示する。第1段階では先端ロジックプロセスとコンパクトなD2DインターフェースによりxPU面積を解放し、第2段階ではRAS、外部メモリ拡張、処理ユニットをベースダイに追加し、第3段階ではzHBMを通じてxPUとDRAMスタックの垂直3D統合を実現する。
要約
本レポートは3段階の進化ロードマップを提示する。第1段階では先端ロジックプロセスとコンパクトなD2DインターフェースによりxPU面積を解放し、第2段階ではRAS、外部メモリ拡張、処理ユニットをベースダイに追加し、第3段階ではzHBMを通じてxPUとDRAMスタックの垂直3D統合を実現する。
- TSV数とピッチは、ベースダイPHYのI/O数および速度とともに、さらなる帯域幅スケーリングにおける主要なボトルネックとなっている。
- HBM4以降、電力増加を抑制し実効面積を削減するため、ベースダイに先端ロジックプロセスを採用することが必要とみなされている。
- コンパクトなD2D PHYはチャネルを短縮し、ビット当たりエネルギーを低減し、xPUに面積を戻す、または新たなベースダイ機能向けに面積を確保できる。
- HPBがPHY領域の50%超をカバーする場合、ピーク温度を35%超低減できる。
- 第2段階では、センサー、自己テスト、外部メモリ制御、処理ユニットをベースダイに統合する。
- 第3段階のzHBMは、分散I/Oと垂直統合により、従来のHBM PHY、D2Dインターフェース、2.5Dインターポーザを不要にする。
レポート解説
概要
本レポートは、AI主導のコンピューティング需要の中でHBMベースダイの役割がどのように変化しているかを論じる。中核的見解は、帯域幅、電力、面積、容量の制約が、先端ロジックプロセスを用いる標準HBMからカスタムHBMへの移行を促し、「xPU面積の回収―機能拡張―3D統合」という3段階の進化に従うというものである。
主要見解
本レポートはまず、HBMスタックにおけるコアダイとベースダイを区別する。コアダイはDRAMセル、コアロジック、TSVを含む一方、ベースダイはコンピュートダイとの通信のためのPHYからTSVへのパスと、DA、MBIST、IEEE 1500などのコアダイ試験機能を提供する。より高い帯域幅が連続するHBM世代の主な推進力となる中、従来アーキテクチャは2つの直接的なボトルネックに直面する。第1にベースダイおよびコアダイスタックにおけるTSV数とピッチの制約、第2にベースダイPHYのI/O数と速度の制約である。そのため本レポートは、急速な帯域幅スケーリングにはベースダイの根本的な変更が必要だと論じる。 プロセス進化がこの変革の基盤を提供する。レポートで示されたロードマップでは、HBM2からHBM3Eの間にベースダイは2*nmから1*nmへ移行し、HBM4およびHBM4Eでは4nmロジックプロセスへ移行する。同じ期間に、xPU SoCは2016年の16n/12nmからHBM4向けの3nm、HBM4E向けの3nm未満へ進化する。SamsungはHBM4でD1c DRAMと4nmロジックプロセスを使用している。本レポートは、単位当たりのエネルギー効率は継続的に改善しているものの、MPGAの総消費電力は上昇し続けていると強調する。したがって、HBM4以降、ベースダイに先端ロジックプロセスを使用することは、電力増加を抑制するうえで不可欠である。また、実効面積を削減し、ベースダイとxPU SoC間のプロセスギャップを縮小する。これはDRAMと先端ロジックの真の統合の始まりと定義される。 この基盤に基づき、本レポートは標準HBMとカスタムHBMを区別する。標準HBMのベースダイは主に基本的なデータおよびテストパスを提供し、その面積の大半は配線に受動的に使用される。これに対しカスタムHBMは、標準的なコアダイスタックを共有しながら、先端ロジックプロセスを使用してベースダイをカスタマイズし、SoCのような機能を持たせる。その背景には、xPUをスケーリングする従来の手法が物理的限界に近づいていることがある。プロセスの微細化は鈍化し、モノリシックダイはレチクルサイズの限界に近づき、マルチチップレットソリューションにおけるインターポーザ寸法も限界に近づいている。ベースダイはすでに先端ロジックプロセスを使用し、利用可能な面積も大きいため、本レポートはxPU機能の一部をベースダイへ移行することを提案する。 第1段階は、xPU面積の回収とインターフェース最適化に焦点を当てる。従来のHBM PHYはベースダイで最大の機能領域を占め、HBM2から標準HBM4にかけて、より高い帯域幅を支えるためにそのフットプリントとチャネル長は拡大を続けた。カスタムHBMは、従来のHBM PHYを先端ロジックプロセスで実装したD2Dインターフェースに置き換える。より小さいインターフェースフットプリントと短いチャネルは、pJ/bを低減し、エネルギー効率を改善し、xPU拡張のために貴重なシリコン面積を解放できる。本レポートは、HBM4からHBM5を、先端ロジックプロセスがPHYおよびD2D面積を大幅に削減する転換期と位置付ける。しかし、この面積削減は電力密度も高め、熱ホットスポットを生じさせる。レポートの比較では、sHBM4EのI/O速度は14Gbps、電力密度は0.5W/mm²であるのに対し、sHBM5のI/O速度は28Gbps超でsHBM4Eの約2倍、電力密度は2.0W/mm²超である。この問題に対処するため、本レポートはSamsungのcHBM4経験に基づくHPB熱経路ブロックを提案する。HPBがPHY領域の50%超をカバーすると、ピーク温度を35%超低減できる。 第1段階には、メモリコントローラをxPU SoCからカスタムHBMベースダイへ移行することも含まれる。本レポートは、この構成により追加コントローラの熱影響を管理可能な範囲に保ちながらxPU面積を回収できるため、メモリコントローラを最優先の移行候補とみなしている。従来のHBMメモリコントローラは現在cHBMへ移植されている。コントローラをメモリに近い位置へ配置すれば、未使用のベースダイ空間をSRAM修復リソースにも使用できる。これは故障セルに対するきめ細かなアドレスデコードとリダイレクトを提供し、チャネル間で修復容量を共有する。コアダイ内の容量が限定的で柔軟性の低い行・列修復リソースと比べ、ベースダイのSRAMソリューションはより大きな容量と高い構成柔軟性を提供する。 第2段階では、メモリコントローラ移行後も利用可能なベースダイ面積を用いて機能を追加する。第1のカテゴリーはRASとテストである。cHBMは温度、電圧、プロセス、経年劣化のセンサーをネイティブに統合し、リアルタイムかつ高速なテレメトリを提供できる。OD-ATEやPGENなどのオンチップ自己テスト機構は、テストカバレッジを拡大し、製造歩留まりを改善できる。第2のカテゴリーは容量拡張である。本レポートは、AIモデルのコンテキストウィンドウが年率30倍で成長してKVキャッシュ要件を大幅に増加させており、長期メモリの保存と検索が次世代AIモデルにおける主要ボトルネックであり続けると指摘する。したがってAI SoCは帯域幅に加えて、より大きなメモリ容量を早急に必要としている。ベースダイは外周部を使用して外部メモリへ直接接続し、専用PHYとコントローラを統合できる。本レポートは、このアプローチが従来のPCIe拡張より大幅に高い帯域幅と低いレイテンシーを実現できると論じる。 第2段階では、xPUの計算処理の一部をベースダイ内の処理ユニットへ移行することもできる。データがメモリにより近い位置で処理されるため、D2D帯域幅要件、データ移動、消費電力、熱負荷を低減できる。2.5Dシステム内の先進HBMソリューションでは、ベースダイ処理ユニットはインターポーザを横断するデータ移動も大幅に削減し、システムレベルのエネルギー効率を改善できる。ただし、このアプローチはベースダイの限られたシリコン面積と、処理ユニットによる局所的な熱密度の上昇に制約される。したがって、機能規模はコンピューティング上の利点、面積、放熱のバランスを取る必要がある。 第3段階は、zHBMが表す真の3D統合である。本レポートは、AIメモリアーキテクチャが急速に密結合へ向かっており、AGIおよび推論シナリオの主要目標は、厳格な電力制約下で帯域幅とTPSを向上させることだと論じる。zHBMはxPUをコアダイスタックと垂直統合し、2.5Dインターポーザを不要にする。分散I/Oは、従来のHBM PHYやD2Dインターフェースなどの二次元インターフェースを排除しながら、スタック内のデータパスを短縮する。主な利点はI/O消費電力の大幅な低減である。SERDESからデータアライメントとDQ I/Oを取り除くことで不要な電力オーバーヘッドを排除でき、節約した電力と熱的余裕をより高いシステムコンピューティング性能へ転換できる。本レポートは、「1 GPU+4 HBM4E」と「1 GPU+4 zHBM」をシステムアーキテクチャ比較の基礎としているが、具体的な定量結果は示していない。 zHBMの実装は、依然として重要なプロセスおよび協調設計能力に依存する。ウェハ・ツー・ウェハ接合とハイブリッド銅接合は超高I/O密度を提供しなければならない。レポートに示されたプロセスには、4層のコアダイとxPUまたは中間層のウェハレベル接合が含まれる。同時に、SoCとDRAMは統一された設計・検証フローを使用して協調アーキテクチャ設計されなければならない。総じて本レポートは、先端ロジック・ベースダイを進化の要とみなす。第1段階ではコンパクトなD2D PHYとコントローラ移行によりxPU面積を回収し、第2段階ではテレメトリ、テスト、容量拡張、処理ユニットを追加し、第3段階ではzHBMにより二次元および2.5Dインターフェースを排除して、xPUロジックとDRAMスタックの直接的な垂直統合および最大限のエネルギー効率を実現する。
分析フレームワーク
本レポートは、HBMコアダイとベースダイの既存の役割分担から出発し、TSV、PHY、消費電力、パッケージ寸法に関わるスケーリング上のボトルネックを特定する。次に、HBM2からHBM4Eまでのプロセスおよびインターフェースの世代変化を用いて、先端ロジックプロセス採用の必要性を示す。その後、面積、チャネル長、ビット当たりエネルギー、電力密度、熱ホットスポットの制約下で、D2Dインターフェース、HPB、メモリコントローラ移行、SRAM修復、RASとテスト、容量拡張、ニアメモリコンピューティング、3D統合を順次評価し、最終的に3段階のアーキテクチャロードマップを構築する。
手法メモ
3段階アーキテクチャ進化ロードマップ
本レポートは、実装順序と技術間の依存関係を説明するため、ベースダイの進化をxPU面積回収、追加機能拡張、真の3D統合という3段階に分けている。
HBM世代別パラメータの比較
本レポートは、HBM2からHBM4Eまでの年次とプロセス、およびsHBM4EとsHBM5のI/O速度と電力密度を比較し、先端ロジックプロセスが生む転換点と、それに伴う新たな熱的制約を特定している。
電力・面積・帯域幅・放熱に関するシステムレベルのトレードオフ
本レポートはメモリチップ自体のみを検討するのではなく、短いインターフェース、機能移行、垂直統合がxPU面積、データ移動、I/O電力、局所熱密度、システム性能の余裕に与える影響を同時に評価している。
主要データ
- HBMプロセス進化タイムライン2016年 HBM2、2019年 HBM2E、2021年 HBM3、2023年 HBM3E、2026年 HBM4、2027年 HBM4Eレポートで提示されたHBM世代および年次
- HBM4/4Eベースダイプロセス4nmベースダイプロセスは、HBM2からHBM3Eの間に2*nmから1*nmへ進化していた
- HBM4コアダイプロセスD1c/1*nmレポートでは、SamsungがHBM4でD1c DRAMおよび4nmロジックベースダイを使用するとしている
- xPU SoCプロセス進化2016年は16n/12nm、2019年は8n/4nm、2021—2023年は4nm、2026年は3nm、2027年は<3nmHBM2からHBM4Eまでのロードマップに対応
- sHBM4E I/O速度14GbpssHBM5との熱密度比較の基準
- sHBM5 I/O速度>28GbpssHBM4Eのおよそ2倍
- PHY電力密度sHBM4Eは0.5W/mm²、sHBM5は>2.0W/mm²PHYの縮小と高速化に伴い、熱ホットスポットのリスクが高まる
- HPBピーク温度低減率>35%PHYカバレッジが>50%の場合
- AIコンテキストウィンドウ成長率年率30倍KVキャッシュおよびメモリ容量要件の急速な増加を示すためにレポートで使用されている
- zHBMシステム比較構成1 GPU + 4 HBM4Eと、1 GPU + 4 zHBMの比較レポートはこの比較に関する具体的な定量結果を提供していない
影響と示唆
本レポートは、HBM競争の次元が帯域幅だけでなく、インターフェースのエネルギー効率、xPU面積利用、RAS、テスト、容量拡張、ニアメモリコンピューティングへと拡大すると論じる。先端ロジック・ベースダイにより、より多くのシステム機能をDRAMの近くに配置できる一方、zHBMは最適化の範囲を個々のメモリデバイスからxPU、DRAM、パッケージングの共同アーキテクチャレベルへさらに拡張する。したがって、放熱、超高密度接合、統一された設計・検証能力が、こうした利点を実現するうえで重要な制約となる。
リスク
- TSV数とピッチ、PHY I/O数と速度、レチクルおよびインターポーザ寸法に関する物理的制約が、従来HBMにおけるさらなる帯域幅スケーリングを制限する可能性がある。
- PHY面積の削減は電力密度を高め、熱ホットスポットを生じさせる。レポートでは、sHBM5のPHY電力密度が2.0W/mm²を超えることが示されている。
- ベースダイへの処理ユニット配置は、利用可能なシリコン面積の制約と局所熱密度の上昇という二重の制約を受ける。
- zHBMの実装は、ウェハ・ツー・ウェハ接合、ハイブリッド銅接合、統一されたSoC—DRAM設計・検証フローに依存する。
注目点
- HBM5のI/O速度が28Gbpsを超える条件下で、HPBがPHYカバレッジ50%超の目標を達成し、35%超のピーク温度低減を維持できるかを注視する。
- 従来のHBMメモリコントローラをcHBMベースダイへ移植する進捗を注視する。
- ベースダイの外部メモリ拡張、オンチップRASセンサー、自己テスト、処理ユニットの実用的な統合を注視する。
- WoW、ハイブリッド銅接合、統一されたSoC—DRAM設計・検証フローがzHBMをどのように支えるかを注視する。