Global AI memory レポート解説
レポートは、トレーニング、推論、RAG、エージェント型ワークフローには、HBM、DRAM、SSD、共有ストレージの異なる組み合わせが必要だと論じる。解読段階のKV cache増加が中心的なメモリ制約であり、新たなメモリ層とアーキテクチャーへの関心を促すとされる。
要約
レポートは、トレーニング、推論、RAG、エージェント型ワークフローには、HBM、DRAM、SSD、共有ストレージの異なる組み合わせが必要だと論じる。解読段階のKV cache増加が中心的なメモリ制約であり、新たなメモリ層とアーキテクチャーへの関心を促すとされる。
- トレーニングはHBMからDRAM、ローカルSSD、ネットワークストレージまで、すべてのメモリ層に依存する。
- 推論のプリフィルは計算律速である一方、デコードはKV cacheがtoken数と同時ユーザー数に応じて増えるためメモリ律速となる。
- CXL、Storage Next、CMXは、従来のシステムメモリ、ローカルSSD、共有ストレージの間に新たな層を追加することを目指す。
- HBF、zHBM、NVHBM、PIM、ストレージクラスメモリなどの新興手法は、容量、帯域幅、レイテンシー、コストのトレードオフ解決を目指す。
レポート解説
概要
この入門レポートは、AIシステムにおける各種メモリ技術の位置づけを説明する。Bernsteinは、ワークロード別の要件と、システム上の位置に基づくアーキテクチャ階層、ストレージ機構とパッケージングに基づくハードウェア階層という二つの補完的な枠組みを用いる。
主要見解
Bernsteinは、タスクごとにメモリ要件が大きく異なるため、Transformerベースの大規模言語モデルのワークロードから説明を始める。トレーニングは計算集約的かつ帯域幅集約的であり、HBMはモデル規模と計算速度に重要である。一方で、データセット向けの低コスト容量、パイプラインのステージング向け高速メモリ、トレーニングが数カ月に及ぶためのチェックポイント保存も必要となる。このため、システムDRAM、ローカルSSD、ネットワークストレージはHBMの代替ではなく必要な補完要素と位置づけられる。 推論はプリフィルとデコードに分かれる。プリフィルはプロンプトを処理して最初のtokenを生成する段階で、大規模な行列演算によりGPUが高稼働となるため、通常は計算律速であり、アクセラレータ内のHBMが相対的に重要となる。主要なレイテンシー指標はtime to first token(TTFT)であり、レポートはチャットボットでは約0.5秒以下が理想、1秒が許容範囲とする。2秒超は、大規模タスクを除き、利用者の不満につながり得る。デコードはtokenを自己回帰的に一つずつ生成する。再計算を回避するため、モデルは過去のtokenをKV cacheに保存する。モデル重みは静的で複数ユーザー間で共有できるが、KV cacheは各tokenで更新され、ユーザーごとに異なる。そのため容量需要はtoken数と同時ユーザー数の両方に比例して増える。Bernsteinはデコードをメモリ律速と説明し、大規模導入ではKV cacheがモデル重みを上回り得るため、コンテキストウィンドウ、同時利用、導入規模、潜在的な収益能力を制約すると論じる。time per output token(TPOT)が主要指標であり、レポートはテキストチャットで最大50 ms、リアルタイム音声、コーディング、エージェント型アプリケーションでは10 ms未満を挙げる。 RAGは異なるストレージパターンをもたらす。大量の非構造化データからベクトルデータベースを作成するには、大容量SSDまたはHDDと、インデックス構築用のシステムDRAMが必要であり、HBMの使用は比較的軽い。Bernsteinはこのオフライン準備を、ユーザー数やtoken量に依存しない一回限りのコストとする。検索時には通常、HBMでクエリを迅速にベクトル化するが、最近傍一致の探索ではシステムDRAMがHBMやSSDより大きな役割を果たす。取得データはその後、通常のプリフィルとデコードに入る。エージェント型ワークフローはこの課題を増幅する。複数ステップのエージェントには計画、分岐、中間結果を記憶するメモリが必要であり、外部ツールの使用は従来型CPU・システムメモリへの需要を増やす。また、出力が後続推論の入力となるため、プリフィル、デコード、KV cacheの需要が積み上がる。 アーキテクチャ階層は、最上位の超低レイテンシーなオンチップSRAMから、HBM、システムDRAM、CXLメモリ、Storage Next、ローカルSSD、CMX、共有SSD/HDD/テープストレージへと続く。HBMはアクセラレータとの共同パッケージングにより、アクティブなモデル重みとKV cacheに高帯域幅・低レイテンシーを提供するため、オンチップメモリの直下に置かれる。システムDRAMは容量が大きい一方、レイテンシーは長い。CXLは物理的に分離したメモリをプールするためのもので、DRAMまたはSRAMキャッシュによってDRAMに近い特性を持たせたNAND製品にも拡張できる。Storage NextはNVIDIA主導の取り組みで、メモリ管理をGPU中心へ移し、NANDの低コスト・大容量を利用しつつ、レイテンシー、IOPS、アクセス粒度の改善を目指す。BernsteinはこれをDDR DRAMとローカルSSDの間に置く。CMXは、計算ノードをまたぐKV cache向けに最適化されたSSDベースの共有層であり、NVIDIAのSTX参照アーキテクチャは相互運用性を促進する意図がある。ローカルSSDはノード内容量を拡張し、共有SSD、HDD、テープは耐久性重視またはレイテンシー感応度の低いデータを担う。 ハードウェア階層は、これらの層の技術的トレードオフを説明する。SRAMは最も低レイテンシーだが、DRAMより大きなシリコン面積を必要とするため、オンチップキャッシュに適する。HBMはXPUの近傍にパッケージングされたDRAMであり、従来型DRAMはシステムメモリとしてもCXL製品にも使われる。BernsteinはDRAMの進化がより小さいプロセスノードによって引き続き進むとし、EUVの戦略的重要性を指摘する。また、中国の研究経路として4F²と3D DRAMを検討する。4F²は一度限りの密度向上をもたらす可能性がある一方、3D DRAMはより長いスケーリング余地を持ち得るが、技術的難度が高く商用化にはなお数年を要し得る。 レポートは複数のHBM・DRAMイノベーションを取り上げる。SamsungのzHBMはHBMスタックをXPU上部に置いて接続を短縮するが、BernsteinはDRAMがプロセッサーの熱に耐えられるか、またハイブリッドボンディングの歩留まりとコストが商用生産に適しているかを疑問視する。NVIDIAのNVHBMはベースダイ設計をNVIDIAに移すことで、XPUダイのコスト低下、計算領域の拡大、帯域幅向上、消費電力低下につながる可能性があるが、メモリサプライヤーの差別化を標準化し、製造価値をファウンドリーへ移す可能性もある。IntelのXBMとZAM、QualcommのHBC、MRDIMM、SOCAMM2、LPCAMM2などのモジュール形式は、帯域幅、熱、消費電力を改善する別の手段として示される。HBCはCoWoSインターポーザーを回避してコストを下げる代わりに性能の一部を譲り、LPDDRを使用する。Qualcommは第1世代をfiscal 2027、第2世代を2028に出荷することを目標とする。 NANDとストレージクラスメモリについて、Bernsteinは強化型NAND製品をDRAMと通常SSDの間に位置づける。Z-NANDとXL-FLASHはSLCまたはMLCを用い、容量・コスト面の優位性の一部を犠牲にして、低レイテンシーと高IOPSを実現する。KIOXIAのGP-series SSDは、2026年に最大10M IOPS、2027年に100M超とされる。レポートは、SLC/MLCベースXL-FLASHをStorage Next型アプリケーション、TLCをコストと性能のバランスを取るCMX製品、QLCをHDDと競合する大容量製品に割り当てる。SanDiskとSK hynixが主導するHBFは、低コスト・大容量のNANDでHBMを補完し、HBM帯域幅に近づくことを狙うが、Bernsteinは複数のハードウェア階層をまたぐ技術的ハードルが高いと強調する。HDDは低コストでアクセス頻度の低いコールドデータに依然適しており、レポートは、急増するストレージ需要とKV cacheオーバーフロー需要がHDDの追い風になるとする。また、NANDとHDDの供給不足を背景に、テープ需要も伸びているとの記述がある。 最後に、PIMは処理とメモリを同じシリコン上に組み合わせ、コンピューティングの主要なボトルネックであるデータ移動を減らす。Bernsteinはその潜在的価値を認めつつも、処理とメモリを分離する既存アーキテクチャーから根本的に異なり、プロセッサー、ソフトウェア、ネットワーク、サプライチェーン全体の大幅な再設計を必要とするため、採用は限定的だと強調する。
分析フレームワーク
Bernsteinはまず、計算能力、帯域幅、容量、レイテンシーのいずれが制約となるかでAIワークロードを分類する。次に、システム内での位置と用途に基づくアーキテクチャ階層、さらにセル設計、パッケージング、ストレージ機構に基づくハードウェア階層を示す。この枠組みにより、既存技術と新興技術のコスト、容量、帯域幅、レイテンシーのトレードオフを説明している。
手法メモ
AIメモリのアーキテクチャ階層とハードウェア階層
レポートはオンチップSRAMからHBM、DRAM、SSD、共有ストレージまでをマッピングし、ワークロード要件がAIメモリのサプライチェーンをどう通過するかを示す。
ワークロード別のメモリ要件
分析ではトレーニング、プリフィル、デコード、RAG、エージェント型ワークフローを区別し、どのメモリ資源がなぜ制約となるかを説明する。
資産マッピングと比較
投資テーゼから固有資産への構造化マッピング(強み、弱み、同業、リスク)。
- Samsung Electronics (005930.KS)カバー対象のメモリサプライヤーであり、zHBM、CXLメモリモジュール、Z-NANDの開発企業。
- 強み
- レポートはzHBM、CMM-HハイブリッドCXLメモリ、Z-SSD製品を取り上げている。
- 比較
- zHBMは、HBMスタックをXPUの上部に配置することで、標準HBMを超えることを目指す。
- リスク
- Bernsteinは、zHBMの熱性能とハイブリッドボンディングの歩留まり・コストの実用性に疑問を呈している。
- SK hynix (000660.KS)カバー対象のメモリサプライヤーであり、HBF参加企業。
- 強み
- レポートはSK hynixをSanDiskと並ぶHBFの主導企業と位置づけ、HBMの例にも用いている。
- 比較
- HBFは、NANDベースのより大きな容量と低コストでHBMを補完することを目指す。
- リスク
- HBFはNANDとHBMの大きな性能差を克服する必要がある。
- Micron (MU)カバー対象のメモリサプライヤーであり、Storage Nextの参加企業。
- 強み
- レポートはMicronのXTR SSDをpSLCの例とし、MicronをStorage Nextの協業先に含めている。
- 弱み
- NVHBMはメモリサプライヤーのベースダイにおける差別化を弱める可能性がある。
- 比較
- MicronはSamsungとともに、標準HBMのベースダイを製造するサプライヤーとして挙げられている。
- リスク
- NVHBMのベースダイ標準化により、価値がNVIDIAとファウンドリーへ移る可能性がある。
- KIOXIA (285A.T)カバー対象のNAND・SSDサプライヤーであり、GP-series SSDはStorage Nextの例として用いられている。
- 強み
- XL-FLASH GP-series SSDは、超高IOPSとStorage Next層での位置づけの例として示されている。
- 比較
- 同社のSLC/MLCベースXL-FLASHは、TLCの密度経済性を犠牲にしてレイテンシーとIOPSを優先する。
- SanDisk (SNDK)カバー対象のNANDサプライヤーであり、HBFの主導企業。
- 強み
- レポートはSanDiskをHBFの主導企業とし、HBF設計を総メモリ容量増加の説明に用いている。
- 比較
- HBFは、低コストで大容量のNANDを用いてHBMを代替するのではなく補完することを目指す。
- リスク
- NANDをHBM帯域幅に近づけるための性能向上には高い技術的障壁がある。
- Seagate (STX)カバー対象のストレージ企業であり、下位の共有ストレージ層に関連する。
- 比較
- HDDはメモリ階層でNANDより下位だが、低コストのコールドストレージとして依然有用である。
- Western Digital (WDC)カバー対象のストレージ企業であり、下位の共有ストレージ層に関連する。
- 比較
- レポートはHDDを、耐久性がありレイテンシー感応度の低いデータ向けG4共有ストレージの選択肢と説明する。
主要データ
- 理想的なチャットボットTTFT0.5 seconds or lowerレポートはこれをtime to first tokenの理想水準とし、1秒は許容範囲としている。
- 大規模タスクで許容され得るTTFTMore than 2 secondsレポートは100ページのPDFの要約などでは許容され得るが、利用者の不満につながる可能性があるとする。
- テキストチャットのTPOTUp to 50 mstime per output tokenの例示的な許容水準。
- 高性能用途のTPOTLess than 10 msリアルタイム音声、コーディング、エージェント型ワークロードの例示的な要件。
- KIOXIA GP-series SSD IOPSUp to 10M in 2026; 100M+ in 2027XL-FLASHベースの高IOPSストレージの例として示される。
- Qualcomm HBCの時期Gen-1 in fiscal 2027; Gen-2 in 2028レポートが引用する会社目標。
影響と示唆
Bernsteinの枠組みは、AIメモリ需要がHBMに限られないことを示す。コンテキストウィンドウの拡大、同時利用の増加、RAGデータセット、エージェント型ワークフローは、DRAM、SSD、HDD、新たな中間層への需要を増やし得る。レポートは、各ソリューションの技術的・商業的価値は、レイテンシー、帯域幅、容量、コストのどのボトルネックを改善するかに依存すると強調する。
リスク
- HBFは、NANDがHBMを補完するために大きな性能差を埋めなければならず、高い技術的ハードルに直面する。
- zHBMは商用生産前に、熱、ハイブリッドボンディングの歩留まり、コスト面の課題に直面する可能性がある。
- PIMはプロセッサー、ソフトウェア、ネットワーク、サプライチェーンのアーキテクチャーに大きな変更を要するため、採用が限定的である。
- 3D DRAMは技術的難度が高く、商用化まで数年を要する可能性がある。