レポート解説
ウォール街の主要投資銀行による最新リサーチをカバー
レポート解説Hilo Research

d-Matrix Raptor 3D-DRAM生成推論アクセラレータ:Raptorは3D-DRAMを用いて生成推論におけるメモリ帯域幅とエネルギーのボトルネックを突破する

本レポートは、d-Matrix Raptorの初期シリコンおよび3D-DRAMコデザインを紹介する。カード当たり32 GBの容量と100 TB/sの帯域幅を備え、ストリームブロッキング、ピンレスDBI、熱対応の信頼性機構により、オーバーフェッチ、I/O消費電力、高温時のリフレッシュ問題に対処する。

機関d-Matrix、Meta
日付20260823
企業d-Matrix Raptor 3D-DRAM生成推論アクセラレータ
業界人工知能推論アクセラレータおよび半導体

要約

本レポートは、d-Matrix Raptorの初期シリコンおよび3D-DRAMコデザインを紹介する。カード当たり32 GBの容量と100 TB/sの帯域幅を備え、ストリームブロッキング、ピンレスDBI、熱対応の信頼性機構により、オーバーフェッチ、I/O消費電力、高温時のリフレッシュ問題に対処する。

証券評価または目標株価はない。レポートはRaptorの技術路線に明確に前向きな見方を示している。
Raptor3D-DRAM生成AI推論長コンテキストメモリ帯域幅コンピュート・メモリコデザイン初期シリコン
  • モデル重みとKVキャッシュは同時に増加する。64ユーザー、ユーザー当たり100万のコンテキスト長では、KVキャッシュは約935 GBとなる。
  • Raptorカードは8つのチップレットで構成され、32 GBの容量と100 TB/sの帯域幅を提供する。72カードラックでは2.3 TBおよび7.2 PB/sに達する。
  • ストリームブロッキングは、3バンクマッピングによる33%のオーバーフェッチを0%まで低減し、約33 TB/sの帯域幅を回収する。
  • ストリームフリッピングは0.8%のメタデータオーバーヘッドでピンレスDBIを実装し、レポートによればI/O電力を20%削減できる。
  • レポートによれば、各種言語モデルおよび音声モデルにおいて、Raptor 3D-DRAMはHBMベースおよびSRAMベースのソリューションに対して、それぞれ4.71倍および2.44倍のスループットを実現する。

レポート解説

概要

本レポートは、生成推論における容量、帯域幅、消費電力間の緊張関係から出発し、d-Matrix RaptorがロジックダイをDRAM上に直接積層し、メモリマッピング、データ伝送、熱リフレッシュ、誤り訂正、冗長化機構を共同設計することで、低レイテンシーかつ長コンテキストの推論に3D-DRAMを活用する方法を説明している。

主要見解

生成推論におけるデータ規模は二方向から同時に拡大している。モデル重みが増え続ける一方、KVキャッシュはコンテキスト長と同時ユーザー数に応じて増加する。レポートは、64ユーザー、ユーザー当たり100万のコンテキスト長ではKVキャッシュが約935 GBになる例を示す。推論のプレフィル段階は一般に計算スループットに制約される一方、自己回帰デコーディングは一般にメモリ帯域幅に制約される。低レイテンシーかつ小バッチのシナリオでは、デコーディングが重要な実行時間を占める。高GQAおよび投機的デコーディングではアテンション計算が計算律速になる可能性があるが、MoEは中程度のバッチサイズおよび投機的デコーディングでもメモリ帯域幅律速のままであり得るため、容量と帯域幅を同時に拡張する必要がある。 レポートは、既存の2種類のメモリにはそれぞれ明確な欠点があると論じる。オンチップSRAMはサブナノ秒レイテンシーを提供する。例として、一対のカードは約300 TB/sの帯域幅、4 GBの容量、約1 nsのレイテンシー、約0.5 pJ/bitのI/Oエネルギー消費を提供できる。しかし、その6T記憶セルはDRAMの1T1Cセルの約10倍の面積を占め、N5からN2ノードにかけてビットセル面積は約0.021 µm²にとどまり、ギガバイト規模の容量ではリーク電力が数十ワットに達し得る。実用容量は約4 GB、コストはDRAMの約100倍である。HBMは高容量を提供するが、パッケージエッジ空間、スタック数、ピン速度、I/O幅に制約される。レポートはHBM4システムの実用的な帯域幅上限を約20 TB/sと見積もる。HBMを2.4 pJ/bitで100 TB/sまで拡張した場合、相互接続電力を除いてもメモリ電力だけで1.92 kWを要する。 Raptorの中核的アプローチは、ロジックとDRAMをフェース・ツー・フェースで積層し、センチメートル規模のインターポーザ経路をPHYによるミリメートル規模の垂直接続に置き換えることにある。レポートは、3D垂直I/Oのエネルギー消費を約0.3~0.4 pJ/bitとし、HBMよりおよそ1桁低いとしている。具体的なインターフェース推定値は0.37 pJ/bitであり、HBM4の約2~3 pJ/bitと比較される。RaptorはTSMC N4/N4Pのロジック上層、3D-DRAM下層、36 µmピッチのフェース・ツー・フェース積層を使用する。各チップレットは4 GBの容量、12.5 TB/sの帯域幅、840個のDRAMマイクロバンクを提供する。8チップレットで32 GB、100 TB/sのカードを構成し、4カードで128 GB、400 TB/sのシステム、合計72カードの18トレイで2.3 TBの容量および7.2 PB/sの帯域幅に達する。 モデルロードの推定では、4ビット重み、8ビットKVキャッシュ、72カードのスケーリングドメインを前提とする。GLM 5.2は総パラメータ数7,440億、アクティブパラメータ数400億を含み、100万のコンテキスト長ではユーザー当たり44.7 GBのKVキャッシュを必要とする。Kimi K3は総パラメータ数2.8兆、アクティブパラメータ数約1,020億を含み、ユーザー当たり11.7 GBのKVキャッシュを必要とする。レポートは、各32 GBのRaptorカード72枚で、コンテキスト長100万のKimi K3を収容できるとし、分離配置および複数ラックによってさらなる拡張が可能としている。結論ではさらに、約3兆パラメータのモデルをコンテキスト長100万で処理する単一Raptorラックは、ユーザー当たり約1,000 TPSを持続的に提供できるとしている。 高帯域幅が実効性能に変換されるためには、コンピュート、メモリ、相互接続を共同設計しなければならない。シャーディングと集団通信を通じて、Raptorは階層型ネットワーク上で約8,000の仮想デバイスを協調させる必要があり、典型的なGPUシステムの約72デバイスと比較される。したがって、アムダールの法則による制約を回避するには低レイテンシーが必要となる。レポートはパッケージ内フルメッシュトポロジーを採用し、物理的な対角線に伴う距離、D2D消費電力、パッケージ層数の増加を回避しつつ、仮想対角リンクを用いてパッケージ内レイテンシーを低減する。カード内およびカード間プロトコルは、送信元カードからの確認応答を必要としない、デバイス起点の単方向プッシュ転送を使用し、複数の短いメッセージ転送を並列にサポートする。 最初の具体的な統合課題は、バンクからチャネルへのマッピングである。各計算エンジンのアクセスには128 Bのデータが必要だが、各バンクのカラムアクセスで返せるのは32 Bにすぎないため、各チャネルには理論上4バンクが必要となる。チップレットには256チャネル、DRAMには840バンクがあるが、72のスペアバンクを差し引くと使用可能バンクは768、すなわちチャネル当たり3バンクしか残らない。直接2回アクセスすると、単一の128 Bフリットに対して192 Bを読み出すため、33%のオーバーフェッチが生じ、約33 TB/sが無駄になる。単純なカラムスタガリング方式では192 Bのシフトバッファが必要となり、タイミング収束と検証の難易度が増す。Raptorは「ストリームブロッキング」を用いる。4番目の32 B部分アクセスを3フリットで共有することで、4×96 Bの入力が正確に3×128 Bの出力となり、オーバーフェッチを0%に低減し、各カラムアクセスを完全に利用して、約33 TB/sの帯域幅を回収する。 第2の課題はI/O消費電力である。100 TB/sかつ0.37 pJ/bitでは、I/O自体が約296 Wを消費する。従来のHBMデータバス反転は、マルチサイクルバースト、完全なバーストに関する事前知識、専用DBIピンに依存する。Raptorの3D-DRAMインターフェースは、バーストやサイドバンドピンを持たない単一サイクルの256ビット転送を使用するため、この機構を直接再利用できない。「ストリームフリッピング」方式は、チャネルごとに隣接フリットを比較する。書き込み時には、反転によってビット遷移が少なくなる場合に現在のフリットを反転し、読み出し時にはECCとともに保存された1ビットタグを用いてデータを復元する。レポートによれば、この方式のオーバーヘッドは0.8%にすぎず、PHYの変更を必要とせず、I/O電力を20%削減できる。 第3の課題は105°Cの接合部温度における信頼性である。標準DRAMの保持時間は85°Cで32 msだが、105°Cでは4 msまで低下し、リフレッシュ頻度が8倍に増加することを意味する。高温はソフトエラーも増加させる一方、840バンクに起因する歩留まりリスク、単一バンク故障によるチャネル非対称性、ECC、スクラビング、リフレッシュ間のスループット競合をすべて同時に対処しなければならない。Raptorは、行数が16~32分の1であるディープバンク構造を活用するため、4 msリフレッシュの帯域幅コストはわずか1.37%であり、約100 TB/sを維持できる。最後の8つのカラム位置には、インターリーブされた[132,128]リード・ソロモン誤り訂正符号とDBIビットが格納される。72個のオンライン冗長マイクロバンクは、2段階のバンクチェーンを使用して任意位置で最大2件の故障を処理し、スペアバンクが補完することで、ほぼ無視できる配線コストで対称的なチャネル幅を維持する。 シリコン面積と実効帯域幅に基づく比較では、Raptorの容量密度は11.4 MB/mm²で、HBM4 24 Gbの21.9、HBM4 32 Gbの26.3、Rubin R200の21.9 MB/mm²を下回る。しかし、帯域幅密度は32.6 GB/s/mm²であり、それぞれ1.67、1.51、1.39 GB/s/mm²を大幅に上回る。RaptorのGB/s当たり消費電力は2.96 mWで、すべての比較対象の40.0 mWに対する値である。この比較では、Raptorの実効帯域幅利用率を83%、Rubinを85%と仮定している。したがってレポートは、低レイテンシー推論には必ずしもカード当たり最大容量を要せず、適度な容量と極めて高い帯域幅の組み合わせの方が適していると強調する。初期シリコン資料ではさらに、Llama-3.1 70B、DeepSeek-V3、Kimi K2、GPT-OS、Whisper、Canaryを含むモデル全体で、Raptor 3D-DRAMはHBMベースのソリューションの4.71倍、SRAMベースのソリューションの2.44倍のスループットを実現し、ネットワークのレイテンシーおよび帯域幅に対する感度も低いとしている。

分析フレームワーク

レポートはまず、生成推論のボトルネックをプレフィル段階とデコーディング段階に分解し、次にSRAM、HBM、3D-DRAMを容量、帯域幅、レイテンシー、I/Oエネルギー消費、パッケージング制約の観点から比較する。その後、チップレットレベルからカード、トレイ、72カードラックまでモデルの容量と帯域幅を推定し、バンクマッピング、I/O消費電力、高温リフレッシュ、ECC、冗長性の課題を一つずつ分析する。最後に、実効帯域幅利用率、シリコン面積当たりの指標、帯域幅単位当たりの消費電力、複数モデルのスループットを比較することで、設計上のトレードオフを検証する。

手法メモ

  • 産業・セクター分析フレームワーク需給フレームワーク

    推論データ要件とメモリ能力のマッチング

    レポートは、増大するモデル重みとKVキャッシュを容量と帯域幅への需要として扱い、この需要をSRAM、HBM、3D-DRAMが提供できる容量、帯域幅、消費電力と比較することで、どのメモリアーキテクチャが長コンテキスト推論により適しているかを判断する。

  • (語彙外の手法)その他

    プレフィル・デコーディングのボトルネック分解

    レポートは、推論プロセスを、一般に計算スループットに制約されるプレフィル段階と、一般にメモリ帯域幅に制約されるデコーディング段階に分け、高帯域幅3D-DRAMが主にどの実行時間部分に対処するかを説明する。

  • (語彙外の手法)その他

    ハードウェア、アーキテクチャ、ワークロードの共同設計

    レポートは、3D-DRAMを外部ストレージとして扱うのではなく、バンクマッピング、データフロー、相互接続プロトコル、リフレッシュ、誤り訂正、冗長化を共同設計し、物理積層が提供する生の帯域幅を実効的な推論スループットへ変換する。

  • (語彙外の手法)その他

    シリコン面積と実効帯域幅の正規化比較

    レポートは、Raptor、HBM4、Rubin R200を平方ミリメートル当たりの容量、平方ミリメートル当たりの帯域幅、GB/s当たりの消費電力で比較する。同時に、名目仕様だけを比較することを避けるため、Raptorの83%およびRubinの85%という実効帯域幅利用率を組み込んでいる。

  • (語彙外の手法)その他

    アムダールの法則

    レポートはこの法則を用いて、メモリ帯域幅が大幅に増加しても、カード内またはカード間の通信レイテンシーが相応に低下しなければ、残る直列要素または通信要素がシステム全体の高速化を依然として制限することを説明する。

資産マッピングと比較

投資テーゼから固有資産への構造化マッピング(強み、弱み、同業、リスク)。

  • d-Matrix Raptor 3D-DRAM生成推論アクセラレータ
    レポートはこれを、長コンテキスト・低レイテンシーの生成推論向け3D積層統合ロジック・メモリプラットフォームとして位置付けている。
    強み
    カード当たり100 TB/sの帯域幅、低いI/Oエネルギー消費、チップレットから72カードラックまでの拡張性、およびストリームブロッキング、ストリームフリッピング、熱対応リフレッシュ、ECC、バンクチェーンを含む共同設計機能。
    弱み
    カード当たり容量は32 GBであり、シリコン面積当たりの容量密度は11.4 MB/mm²で、レポートに示されたHBM4およびRubin R200の数値を下回る。またシステムは約8,000の仮想デバイスを協調させる必要がある。
    比較
    レポートは、Raptorの帯域幅密度を32.6 GB/s/mm²、帯域幅単位当たりの消費電力を2.96 mW/GB/sとし、比較対象のそれぞれ1.39~1.67 GB/s/mm²および40.0 mW/GB/sと比較している。複数モデルのスループットは、HBMベースおよびSRAMベースのソリューションよりそれぞれ4.71倍および2.44倍高い。
    リスク
    統合リスクには、3D積層の熱管理および電力供給、マイクロバンプ歩留まり、バンク故障、105°Cでのリフレッシュおよびソフトエラー、広幅並列バスの信号完全性、複数チップレットおよび複数カード間の通信レイテンシーが含まれる。

主要データ

  • コンテキスト長100万における64ユーザーのKVキャッシュ約935 GB長コンテキストと同時ユーザーがメモリ容量要件を共同で増幅する様子を示す。
  • SRAM仕様例300 TB/s、4 GB、約1 ns、約0.5 pJ/bit帯域幅とレイテンシーは優れるが、容量、リーク、コストがスケーリングを制約する。
  • 実用的なHBM4帯域幅上限約20 TB/sパッケージエッジ空間、スタック数、I/Oスケーリングに制約される。
  • 100 TB/s時のHBMメモリ電力1.92 kW2.4 pJ/bitで計算され、相互接続電力は除外されている。
  • Raptor単一カード32 GB、100 TB/s各4 GBおよび12.5 TB/sを提供する8つの3D-DRAMチップレットで構成される。
  • Raptor 72カードラック2.3 TB、7.2 PB/s18トレイおよび72カードで構成される。
  • GLM 5.2モデル推定総パラメータ数744B、アクティブパラメータ数40B、KV/ユーザー44.7 GBコンテキスト長100万を前提とする。
  • Kimi K3モデル推定総パラメータ数2.8T、アクティブパラメータ数約102B、KV/ユーザー11.7 GB32 GBカード72枚でコンテキスト長100万のモデルを収容できる。
  • 元のバンクマッピングにおけるオーバーフェッチ33%、約33 TB/sチャネル当たり3バンクしかないため、128 Bフリットを直接読み出すには192 Bを取得する必要がある。
  • ストリームブロッキングの効果オーバーフェッチ0%部分アクセスを共有した後、384 Bの入力は384 Bの実効出力に対応する。
  • 100 TB/s時の3D-DRAM I/O電力296 W0.37 pJ/bitで計算。
  • ストリームフリッピングの効果20%の省電力、0.8%のオーバーヘッドタグはECCとともに保存されるため、追加のPHYサイドバンドピンを必要としない。
  • 105°Cにおけるリフレッシュ要件32 msから4 msに低下、リフレッシュ頻度は8倍に増加ディープバンク設計により帯域幅コストは1.37%に抑えられる。
  • 帯域幅密度Raptor 32.6 GB/s/mm²、HBM4およびRubin R200は1.67、1.51、1.39 GB/s/mm²実効帯域幅ベースで比較。
  • 帯域幅単位当たりの消費電力Raptor 2.96 mW/GB/s、比較対象40.0 mW/GB/s低いほど良い。
  • 複数モデルにおけるスループット比較HBMより4.71倍高く、SRAMより2.44倍高いレポートに記載された言語モデルおよび音声モデルのワークロードを対象とする。

影響と示唆

本レポートは、生成推論アクセラレータにおける競争が、単に計算ユニットを追加することから、データ容量、帯域幅、エネルギー消費、通信レイテンシーを同時に解決する方向へ移行していると論じる。Raptorは、HBMを大きく上回る帯域幅密度と帯域幅単位当たりの低消費電力を得る代わりに、単位面積当たりの容量密度を一部犠牲にしている。バンクマッピング、伝送符号化、高温リフレッシュ、ECC、冗長化の設計が初期シリコン結果で示されたとおりに機能すれば、このカード当たり適度な容量と極めて高い帯域幅の組み合わせは、長コンテキスト・低レイテンシーのデコーディングを改善し、72カードラックへの兆パラメータモデルのスケーリングを支援し得る。

リスク

  • アクセラレータの熱は温度に敏感なDRAMスタックを通じて放散される必要がある一方、数百ワットの電力をTSV経由で供給しなければならず、接合部温度、電圧降下、熱の制約を生む可能性がある。
  • 840バンクおよび36 µmマイクロバンプは歩留まりとアライメントのリスクを高める。1%の故障率であっても、チャネル全体を無効化するか、チャネル非対称性を引き起こす可能性がある。
  • 105°CではDRAM保持時間が32 msから4 msへ低下し、リフレッシュ頻度が8倍に増加する。ソフトエラー、ECC、スクラビング、リフレッシュの協調が不十分であれば、スループットを低下させる可能性がある。
  • 広幅並列バスは、クロストーク、同時スイッチングノイズ、クロック分配、スタック間スキューの問題に直面する。
  • 約8,000の仮想デバイスにまたがるシャーディングと集団通信は、ネットワークトポロジー、プロトコル、帯域幅、低レイテンシーに厳しい要件を課す。
  • 複数積層層への拡張は依然として配線、電力供給、熱管理の課題に直面する。また、ハイブリッドボンディングの経路も、2 µm未満のピッチおよび8層積層に向けて進展する必要がある。

注目点

  • より多くの実環境の生成推論ワークロードにおいて、初期シリコンの100 TB/s実効帯域幅、消費電力、スループット結果が検証されるかを注視する。
  • 72カードおよび複数ラックの配置において、シャーディング、集団通信、ネットワークレイテンシーがレポート記載のスケーリング効率を維持できるかを注視する。
  • 105°C環境における4 msリフレッシュ、インターリーブECC、スクラビング、72個のスペアバンクの長期信頼性を注視する。
  • 2 µm未満のピッチおよび8層積層に向けたハイブリッドボンディングのロードマップ、ならびに多層スタックにおける配線、電力供給、熱管理の進展を注視する。

設定

最近のログインを表示するにはログインしてください