半導体メモリおよび先端パッケージング:HBMはAIシステムのメモリ帯域幅の上限を引き上げ、先端パッケージング、熱管理、信頼性が次のスケーリング段階で重要になる
Micronは、AIモデルの継続的なスケーリングにより、メモリ帯域幅がシステム性能のボトルネックになりつつあると考えている。HBMは、高並列性、広いインターフェース、3D積層により、コンピューティングとメモリのギャップを大幅に縮小する。HBM4は帯域幅と容量をさらに高める一方、シリコン消費量、パッケージングの複雑性、熱管理、信頼性の課題も増大させる。
要約
Micronは、AIモデルの継続的なスケーリングにより、メモリ帯域幅がシステム性能のボトルネックになりつつあると考えている。HBMは、高並列性、広いインターフェース、3D積層により、コンピューティングとメモリのギャップを大幅に縮小する。HBM4は帯域幅と容量をさらに高める一方、シリコン消費量、パッケージングの複雑性、熱管理、信頼性の課題も増大させる。
- Rooflineモデルは、HBMがメモリ帯域幅の上限を引き上げ、メモリ集約型AIワークロードがボトルネックに達する前により高い性能を達成できることを示している。
- 例示システムでは、8個のHBM3スタックが5.3 TB/sの理論帯域幅を提供するのに対し、8チャネルDDR5システムは307 GB/sである。
- HBM4の公称帯域幅は2800 GB/sで、チャネル数は32、データI/O数は2048に増加する。
- HBM3E容量の提供にはDDR5の約3倍のシリコンが必要であり、設計、パッケージング、製造の複雑性に伴う複合コストを反映している。
- 54日間のLlama 3 405B事前学習記録では、予期しない中断の約78%が、確認済みまたは疑いのあるハードウェア問題に起因していた。
- より高速なD2D、より高層のスタック、液冷、ハイブリッドボンディング、より大きなインターポーザは、その後のスケーリングに向けた重要な技術方向である。
レポート解説
概要
これはMicronが発表したAIメモリアーキテクチャに関する技術レポートである。大規模モデルとアクセラレーテッド・コンピューティングにおいて、なぜメモリが中核的制約となったのか、またHBMが高帯域幅、高並列性、ヘテロジニアス統合を通じて「メモリウォール」をどのように緩和するかを説明することに焦点を当てている。レポートはHBM1からHBM4までの進化を概観し、高速インターコネクト、先端パッケージング、熱管理、信頼性に関する将来の課題も論じている。
主要見解
レポートは大規模モデルのスケーリング則から始まる。言語モデルの性能は、モデル規模、データセット規模、学習コンピュートの増加に伴い滑らかに向上するが、3要素は同時にスケールする必要があり、いずれか一つのボトルネックが全体の向上を制限する。GPUコンピュート性能が上昇し続ける中、データがプロセッサに十分迅速に到達しないことによる「メモリウォール」が一層顕著になっている。したがってメモリは補助的なコンポーネントから、AIシステム性能が継続的にスケールできるかを決定する中核要素へと進化している。 レポートはこの制約を説明するためにRooflineモデルを使用する。このモデルは、1秒当たりの演算数による達成可能性能と、1バイト当たりの演算数による演算強度を測定する。演算強度が低いアプリケーションは、性能がメモリ帯域幅によって決まるメモリバウンド領域で動作する一方、演算強度が高いアプリケーションはコンピュート能力によって制約される可能性が高い。HBMはメモリ帯域幅の上限を引き上げ、メモリ集約型AIワークロードが帯域幅制限に達する前により高い性能を達成できるようにし、コンピュート能力とデータ供給能力の間の「コンピュート・メモリ・ブリッジ」として機能する。 HBMは、複数の独立チャネル、広いI/O、短距離ポイントツーポイント接続、3D積層を通じて高並列性を実現する。各DRAMダイには複数の独立チャネルが含まれ、各チャネルにはコマンドおよびアドレスバスを共有する一方で独立したデータバスを使用する2つの擬似チャネルがある。ベースダイはホストとDRAM間のコマンドおよびデータインターフェースを処理し、マイクロバンプPHYはホストをベースダイに接続し、3D TSV PHYはDRAMスタックをベースダイに接続する。HBM3Eはダイ当たり128バンクであり、HBM4では256に増加する。高密度インターポーザ接続は、HBM3Eの約1K I/OからHBM4の約2K I/Oへ増加する。 世代別仕様は、HBMが帯域幅、チャネル数、容量において継続的に進化していることを示す。HBM1、HBM2、HBM2E、HBM3、HBM3E、HBM4のそれぞれのマイルストーンは、2014年、2018年、2020年、2022年、2024年、2026年である。チャネル数はそれぞれ8、8、8、16、16、32、擬似チャネル数はなし、16、16、32、32、64、擬似チャネル幅は128、64、64、32、32、32ビットである。バースト長はHBM1の2からHBM2およびHBM2Eの4へ、その後HBM3以降は8へ増加した。プリフェッチ幅は全世代で256ビットである。データI/O数はHBM1からHBM3Eまで1024で推移し、HBM4では2048へ増加した。 HBM1からHBM4までの対応する公称データレートは1、2.4、3.6、6.4、8、11 Gbpsであり、公称帯域幅は128、307、460、819、1024、2800 GB/sである。DRAM密度はそれぞれ2、8、16、16、24、24 Gbである。スタック高さはHBM1の4層から、HBM2およびHBM2Eの4/8層、HBM3の8/12層、HBM3EおよびHBM4の8層以上へと進化した。これに伴い、スタック当たり容量は1 GBから4/8 GB、8/16 GB、16/24 GBへ増加し、HBM3EおよびHBM4では24 GB以上に達した。各世代は、帯域幅、アクセス粒度、効率、容量をそれぞれ改善するため、データレート、擬似チャネル数、密度、スタック高さを同時に引き上げている。 システム比較はHBMの帯域幅優位性をさらに示している。8本のDDR5チャネルを用いる例示システムは、チャネル当たり2つの32ビットサブチャネルを備え、4800 MT/sで307 GB/sの理論帯域幅を持つ。チャネル当たり2ランク、DIMM当たり64 GBと仮定すると、総容量は1 TBに達する。8個のHBM3スタックで構成される別の例示システムは、5.2 Gbpsで5.3 TB/sの理論帯域幅を持ち、スタック当たり16チャネル、チャネル当たり2つの32ビット擬似チャネルを備える。スタック当たり24 GBの場合、総容量は192 GBである。この2つのアーキテクチャは異なる優先順位を反映している。従来のDIMMはより大きな容量を提供する一方、HBMはGPU近傍に配置され並列インターフェースを拡張することで、容量を犠牲にしてシステム帯域幅を一桁増加させる。 コアレベルでは、8 Gbpsで動作する256 I/Oは256 GB/sの帯域幅を提供できるのに対し、8 Gbpsで動作する8 I/Oは8 GB/sにとどまる。例示されたバンク数の比較は128対32である。同時に、HBM性能にはリソースコストも伴う。アーキテクチャ設計、先端パッケージング、製造の複雑性の組み合わせにより、同等のHBM3E容量の提供にはDDR5の約3倍のシリコンが必要となる。したがって、HBMのスケーリングは単なるDRAMプロセスの問題ではなく、パッケージング技術、I/O回路、インターポーザプロセス、CMOSプロセスの協調的最適化にも依存する。 レポートはAIメモリ要件を、性能、容量、スケーラビリティ、低消費電力の4領域に要約している。性能には速度と帯域幅だけでなく、信頼性とフォールトトレランスも含まれる。容量はモデルパラメータ、ファイル、キャッシュを保持するために必要である。低消費電力はエネルギー効率およびAIエッジデバイスの展開に影響する。より高速なI/Oとより大きなシステム・イン・パッケージ設計が出現するにつれ、将来のイノベーション方向には、メモリ最適化SERDES D2D PHY、コパッケージド・オプティクス(CPO)、より大きなCoWoS-LまたはCoWoS-R型SiP、ガラス基板が含まれる。これらの技術は接続性を拡張し、高速リンクにおける損失を低減するが、システム協調設計の難易度も高める。 チップ・パッケージ相互作用も重要な課題である。複雑なヘテロジニアス統合HBMデバイスでは複数の材料が使用され、その熱膨張係数の不一致が熱機械応力を発生させ、構造健全性と長期信頼性に影響する可能性がある。信頼性、可用性、保守性も大規模学習に直接影響する。レポートが引用するLlama 3 405Bの事前学習記録は54日間を対象とし、その間の予期しない中断の約78%は確認済みまたは疑いのあるハードウェア問題に起因していた。内訳は、GPU故障148件で30.1%、GPU HBM3メモリ72件で17.2%、ソフトウェア不具合54件で12.9%、ネットワークスイッチまたはケーブル35件で8.4%、計画外ホスト保守32件で7.6%、GPU SRAMメモリ19件で4.5%、GPUシステムプロセッサ17件で4.1%であった。これらのデータは、AIクラスター性能がピーク帯域幅だけでなく、長期運用中のメモリおよびコンピューティングハードウェアの安定性にも依存することを示している。 信頼性問題に対処するため、HBM3は2層のECCカバレッジを提供し始めた。システムレベルのカバレッジでは、256ビットアクセスごとに16メタデータビットを提供し、システムがCRCまたはECCを適用できるようにする。ダイレベルのカバレッジでは、DRAM内部でシンボルベースのReed-Solomon ECCを実装する。レポートは、このようなエンドツーエンド保護が、HBMが継続的学習と高可用性コンピューティングを支えるための重要な構成要素であると論じている。 高速D2Dインターコネクト、ベースダイ機能、DRAMダイの活動、スタック高さが増加するにつれ、熱管理はより困難になる。レポートは液冷とハイブリッドボンディングを重要な対応策として挙げ、先端パッケージングは、マイクロバンプ、パッド、TSVを含む面積密度I/Oスケーリング、より細い線幅と間隔を含む横方向I/Oスケーリング、アレイおよびCMOSの分割、ホットスポットと電力供給ネットワークの管理を同時に進展させなければならないと指摘する。積層・ボンディングの経路にはCoS、CoW、C2C、C2W、W2W、マイクロバンプ、フュージョンボンディング、ハイブリッドボンディングが含まれ、将来のHBM性能向上がメモリ、ロジック、パッケージング、熱管理、製造のエコシステム全体にわたる緊密な協力に依存することを示している。 レポートは、AIアプリケーションの普及速度を示すため、ChatGPTがわずか2カ月で1億ユーザーに到達したことを指摘し、これに基づき業界が前例のない加速段階にあることを強調して締めくくる。中核的な結論は、HBMがAIアクセラレーテッド・コンピューティングの基盤コンポーネントとなった一方、帯域幅と容量の継続的な拡大は個別メモリ技術のアップグレードだけには依存できないというものである。高速インターコネクト、パッケージサイズ、材料応力、熱密度、誤り訂正、システム保守性に関する課題にも並行して対処しなければならない。
分析フレームワーク
レポートは以下の順序で進められる。AIスケーリング要件、メモリボトルネック、HBMの動作原理、世代別仕様の進化、システムレベルの比較、パッケージングとインターコネクト、信頼性および熱管理の課題である。まず大規模モデルのスケーリング則とRooflineモデルを用いて、なぜ帯域幅が性能を制限するのかを説明し、次にHBM1からHBM4までの仕様表、DDR5およびHBMシステムの例、学習中断の根本原因データを用いて差異を定量化する。最後に、チップ、パッケージング、材料、熱管理、誤り訂正の観点から、継続的なスケーリングに必要な技術方向を提案する。
手法メモ
Roofline性能モデル
このモデルは達成可能なコンピューティング性能を演算強度に関連付け、ワークロードがメモリ帯域幅またはコンピュート能力のどちらに制約されるかを区別するために用いられる。レポートはこれを用いて、HBMが帯域幅の上限を引き上げ、メモリ集約型AIタスクの性能を改善する仕組みを説明している。
大規模モデルのスケーリング則
レポートは、モデル規模、データセット規模、学習コンピュートが同時にスケールする必要があるという経験則を引用し、メモリがコンピュート能力と併せてアップグレードされなければ、AI性能のさらなる改善に対するボトルネックとなることを説明している。
世代別仕様およびシステムアーキテクチャ比較
レポートはHBM1からHBM4のチャネル、I/O、レート、帯域幅、密度、容量を比較し、8チャネルDDR5システムと8スタックHBM3システムを並べ、それぞれの異なる容量および帯域幅の優先順位を示している。
予期しない中断の根本原因分類
レポートは、長期の大規模モデル事前学習中の中断をGPU、HBM3メモリ、ソフトウェア、ネットワーク、ホスト保守、その他の原因別に分類し、ハードウェア信頼性がAIクラスターの実効稼働時間にどのように影響するかを示している。
主要データ
- HBM世代別タイムラインHBM1 2014年、HBM2 2018年、HBM2E 2020年、HBM3 2022年、HBM3E 2024年、HBM4 2026年レポートに示された製品進化のマイルストーン
- HBM公称帯域幅128、307、460、819、1024、2800 GB/sそれぞれHBM1、HBM2、HBM2E、HBM3、HBM3E、HBM4に対応
- HBM公称データレート1、2.4、3.6、6.4、8、11 GbpsそれぞれHBM1からHBM4に対応
- HBM4のチャネルおよびI/O32チャネル、64擬似チャネル、2048データI/OHBM3Eはそれぞれ16チャネル、32擬似チャネル、1024データI/O
- DDR5例示システム307 GB/sの理論帯域幅および1 TBの容量8チャネル、4800 MT/s、チャネル当たり2つの32ビットサブチャネル、チャネル当たり2ランク、DIMM当たり64 GB
- HBM3例示システム5.3 TB/sの理論帯域幅および192 GBの容量8スタック、5.2 Gbps、スタック当たり16チャネル、スタック当たり24 GBの容量
- HBM3Eのシリコン消費量DDR5の約3倍レポートはこれをアーキテクチャ設計、先端パッケージング、製造の複雑性に伴う複合オーバーヘッドに起因するとしている
- 予期しない学習中断に占めるハードウェアの割合約78%54日間のLlama 3 405B事前学習中に確認済みまたは疑いのあるハードウェア問題に起因
- 主な中断カテゴリGPU故障:148件、30.1%;GPU HBM3メモリ:72件、17.2%;ソフトウェア不具合:54件、12.9%レポートに示された予期しない中断の根本原因における上位3カテゴリ
- HBM3システムレベル誤り訂正メタデータ256ビットアクセスごとに16メタデータビットを設定システムはCRCまたはECCを使用でき、ダイレベルのReed-Solomon ECCも提供される
- ChatGPTのユーザー普及速度2カ月で1億ユーザーに到達AIアプリケーション採用の速度を示すためにレポートで使用
影響と示唆
レポートは、AIシステム設計がGPUピークコンピュート性能の単独追求から、コンピューティング、メモリ、インターコネクト、パッケージングの協調的最適化へ移行していると論じている。HBMはデータ供給速度を大幅に高められるが、より高い帯域幅と容量は、シリコン消費量、I/O密度、スタック高さ、熱負荷も増大させる。したがって将来の性能スケーリングは、先端パッケージング、高速D2D、液冷、ハイブリッドボンディング、ECC、業界横断的な協業が同時に進展できるかに依存する。
リスク
- メモリ帯域幅がモデル規模およびコンピュート能力と同時にスケールできなければ、プロセッサはデータ待ちの間にコンピュート能力を十分活用できない。
- HBMヘテロジニアスパッケージングにおける異なる材料間の熱膨張係数の不一致は、熱機械応力を生じさせ、チップ・パッケージ相互作用リスクを生み出す可能性がある。
- 高速インターコネクト、ベースダイ機能、DRAM活動、スタック高さの増加は熱密度を高め、放熱をより困難にする。
- 長期のAI学習はハードウェア信頼性に非常に敏感であり、引用された54日間の学習記録における予期しない中断の約78%は、確認済みまたは疑いのあるハードウェア問題に関連していた。
- HBM3E容量にはDDR5の約3倍のシリコンが必要であり、先進的な設計、パッケージング、製造の複雑性がリソースおよび生産上の課題を生み出す。
注目点
- HBM4の32チャネル、64擬似チャネル、2048 I/O、2800 GB/sの公称帯域幅が、AIワークロードの次段階を支えられるかどうか。
- メモリ最適化SERDES D2D PHY、コパッケージド・オプティクス、より大きなSiPインターポーザの進展。
- 液冷およびハイブリッドボンディングが、より大きなDRAM活動と高層スタックに起因する熱管理問題に対してもたらす改善。
- マイクロバンプ、TSV、線幅・間隔スケーリング、ガラス基板などの先端パッケージング技術の進化。
- システムレベルのCRCまたはECC、およびダイレベルのReed-Solomon ECCによるAI学習の信頼性および保守性の改善。