Global AI memory レポート解説
Bernsteinは、トレーニング、推論、RAG、エージェント型ワークフローが異なるメモリーボトルネックを生み、より広範なAIメモリー技術階層を促すと説明する。レポートは、KVキャッシュ集約型の推論を、容量、帯域幅、低コストメモリー革新の主要な触媒として強調する。
要約
Bernsteinは、トレーニング、推論、RAG、エージェント型ワークフローが異なるメモリーボトルネックを生み、より広範なAIメモリー技術階層を促すと説明する。レポートは、KVキャッシュ集約型の推論を、容量、帯域幅、低コストメモリー革新の主要な触媒として強調する。
- トレーニングには全メモリー階層が必要で、HBMは帯域幅に重要、DRAM・SSD・ネットワークストレージはデータセット、ステージング、チェックポイントに必要となる。
- 推論プレフィルは計算律速だが、デコードはKVキャッシュがtoken数と同時ユーザー数の双方で増えるためメモリー律速となる。
- レポートは、オンチップSRAMからHBM、システムメモリー、CXL、Storage Next、ローカルSSD、CMX、共有ストレージまでのアーキテクチャ階層を整理する。
- HBFはNANDの容量と低コストをHBM級帯域幅と組み合わせることを目指すが、Bernsteinは必要な性能飛躍が技術的に困難とみる。
- 新たなアーキテクチャは、メモリー供給企業、GPU設計企業、ファウンドリー、パッケージング企業、ストレージ供給企業の間で価値を再配分し得る。
レポート解説
概要
本プライマーは、AIメモリー需要とその課題に対応する技術を理解する枠組みを示す。Bernsteinは、AIが単一のメモリー市場を生むのではなく、ワークロードとデータの位置によって高帯域幅、低遅延、容量、コスト、共有アクセスのどれが重要かが決まると論じる。
主要見解
Bernsteinは、AIワークロードごとにメモリーへの要求が異なるとする。トレーニングは計算集約的で、しばしば帯域幅に制約されるためHBMが重要である。一方、大規模データセットはより低速で安価なストレージに準備・保存し、HBMへコピーする前に高速な階層でキャッシュ・ステージングする必要がある。トレーニングは数か月に及び得るため、ハードウェアまたはソフトウェア障害時に最初から再開しないようチェックポイントも必要となる。従って、システムDRAM、ローカルSSD、ネットワークストレージはHBMの代替ではなく、HBMとともに不可欠である。 Transformer推論について、レポートはプレフィルとデコードを分ける。プレフィルはプロンプトを処理して最初のtokenを生成し、大規模な行列・行列演算を行うため通常は計算律速である。このためアクセラレータ性能とHBMの重要性が相対的に高い。重要指標はTTFTであり、チャットボットでは約0.5秒以下が理想、1秒が許容可能、2秒超は大きなタスクでは容認され得るものの、多くの場合ユーザーの不満やプロンプト放棄につながり得るとする。 デコードはtokenを自己回帰的に生成する。再計算を避けるため、先行tokenはキー・バリューペアとして保存され、KVキャッシュ需要はtoken数に比例して増える。読み取り専用のモデル重みと異なり、KVキャッシュはtokenごとに更新され、ユーザー固有で、同時ユーザー数とともに増加する。Bernsteinはそのためデコードをメモリー律速と位置付ける。コンテキスト長と同時ユーザー数の複合的な増加により、KVキャッシュはモデル重みを上回り、コンテキストウィンドウとユーザー容量を制約し、AI展開の規模と収益容量を左右し得る。TPOTが主要指標であり、テキストチャットでは50ms、すなわち毎秒20 tokenまでが許容され得る一方、リアルタイム音声、コーディング、エージェント型用途では10ms未満が必要となる。 RAGは異なるストレージ特性をもたらす。データベース生成では大量の文書、コード、ウェブページをベクトルデータベースと検索可能なインデックスに変換するため、大容量ストレージと、インデックス生成用の大規模なシステムDRAMが必要であり、HBMの重要性は相対的に低い。これはユーザー数やtoken数から独立したオフラインの一回限りのコストでもある。検索では、クエリのベクトル化にHBMを素早く使用できるが、近傍一致の探索では通常、HBMやSSDよりシステムDRAMが重要となる。取得データはその後、通常のプレフィル・デコード推論に戻る。エージェント型ワークフローは、反復的な計画、ツール、外部環境、中間状態の保持を伴うため、これらの需要を増幅する。CPUと従来型サーバーメモリーの需要も増え、エージェント間で渡される出力は追加のプレフィル、デコード、KVキャッシュ負荷を繰り返し発生させる。 レポートはこれらをアーキテクチャ上のメモリー階層として整理する。最上位のG0メモリーは通常、アクセラレータに埋め込まれたSRAMで、即時かつ遅延に敏感な計算に使われる。G1 HBMはその直下でアクセラレータと同一パッケージに実装され、高帯域幅と低遅延を実現する。G2システムメモリーはCPU管理の、より大容量だが低速のDRAMであるが、一部GPUは直接アクセスできる。CXLは、物理的に分離したメモリーを論理的に共通プールへまとめ、キャッシュでDRAMに近づけたNAND製品まで拡張できるためG2.5に分類される。NVIDIAのStorage NextはG2.6とされ、GPU中心の管理を通じ、NANDの低コスト・大容量とDRAMに近い遅延、IOPS、アクセス粒度を組み合わせようとする。多くの場合DRAM/SRAMとNANDのハイブリッドを使う。 その下にG3ローカルSSDがあり、ノード内容量を拡張するがpod間で共有できない。G3.5 CMXはNVIDIAのKVキャッシュ向けコンテキストストレージ層である。CMX対応SSDはデータノードに置かれ、Ethernet、Spectrum-Xスイッチ、BlueField-4 DPU経由で複数の計算ノードからアクセスでき、GPUはCPUを介さずにアクセスできる。BernsteinはSTXを、互換CMXストレージとODMソリューションを統合するNVIDIAの参照アーキテクチャと説明する。G4共有ストレージはSSD、HDD、テープからなり、即時のクリティカルパス外にある永続データを対象とする。HDDは低頻度アクセスのコールドデータ向け低コスト選択肢であり、拡大するデータストレージとKVキャッシュのオーバーフロー需要から恩恵を受ける。NANDとHDDで需要を満たせない場合、テープ需要も増加し得る。 ハードウェア階層は、これらの階層を支えるコスト、遅延、技術上のトレードオフを示す。SRAMはDRAMより高速だが、より多くのシリコン面積を要し、通常は論理ダイに埋め込まれてキャッシュとして使われる。L1は計算回路に最も近く容量が最小である。組み込みDRAMは大容量キャッシュでSRAMと競合し得るが、シェアは小さい。HBMはDRAMの一種で、従来DRAMとウェハー能力を共有し、従来DRAMはシステムメモリーおよびCXL階層にも参加できる。BernsteinはDRAMの技術進化が依然として主にリソグラフィ縮小で進み、先端DRAMにはEUVが必要だとする。中国のEUV不足はCXMTの長期競争力を制約するとみる。4F² DRAMは周辺回路の移動による一回限りの密度改善である一方、3D DRAMはより長いスケーリング余地を持ち得るが、技術的難度が高く商用化まで数年を要する。 高性能メモリー向けの複数の技術には、それぞれ実装リスクがある。SamsungのzHBMはHBMをアクセラレータ上部に置いて接続を短縮するが、BernsteinはDRAMがプロセッサの熱に耐えられるか、ハイブリッドボンディングの歩留まりとコストが商用生産に対応できるかを問題視する。NVIDIAのNVHBMはメモリーコントローラー機能をNVIDIA設計のベースダイに移し、アクセラレータコストの削減または計算回路向け面積の確保、帯域幅と消費電力の改善を可能にし得る。ただし、メモリー供給企業のベースダイ差別化の一部を標準化し、製造価値を最も可能性の高いTSMCなどのファウンドリーへ移すとBernsteinは論じる。IntelのXBMは、ロジックと共存し得て、コンピュート・イン・メモリー候補にもなり得る新興の後工程DRAM概念だが、製造互換性と将来の生産者は不確実である。IntelのZAMはDRAMダイを横向きに配置して熱放散を改善し、実用化目標はFY2029だが、再配置されたダイ間の無線データ伝送が課題である。QualcommのHBCはCoWoSとインターポーザのコストを回避するためHBMより低い性能を受け入れ、LPDDRで低消費電力を狙う。Qualcommは第1世代を2027年度、第2世代を2028年に出荷する目標を示している。 MRDIMM、SOCAMM2、LPCAMM2といったモジュール革新はシステムメモリー性能の向上を目指す。MRDIMMは帯域幅向上のためインターフェースチップを追加する。SOCAMM2はLPDDR、128-bitデータバス、低いプロファイルを使い、電力消費を抑え、モジュール当たり帯域幅を増やし、AIサーバーの気流を改善する。PIMはロジックとメモリーを組み合わせてコンピューターの中心的なボトルネックであるデータ転送を減らすが、処理とメモリーを分離する現在の主流アーキテクチャから根本的に異なるため、プロセッサ、ソフトウェア、ネットワーク、既存のロジック・メモリー供給網全体の変更を必要とし、採用は限定的である。 ストレージクラスメモリーについて、BernsteinはDRAMとNANDの間に位置付ける。MRAM、PCM、RRAMはDRAMやNANDと根本的に異なる機構を用い、強化NANDはキャッシュまたはセルモードのトレードオフで高IOPS、低遅延、細かなアクセス粒度を目指す。KIOXIAのXL-FLASHはSLCおよび後にMLCを用いて高IOPSのGPシリーズSSDを支え、レポートは今年10M IOPS、2027年に100M+を引用する。SamsungのZ-NAND/Z-SSDも超低遅延を目標とする。BernsteinはSLC/MLC製品をStorage Next型用途、TLCを性能とコストを両立するCMX製品、QLCをHDDと競合する大容量製品に対応付ける。MicronのXTR SSDはpSLCの例で、TLC対応セルの一部に1 bitのみを保存し、SLCに近い耐久性と速度を得る。 SanDiskとSK hynixが主導するHBFは、NANDの大容量・低ビットコストでHBMを補完しながらHBM並みの帯域幅を目指す、Bernsteinの主要なNANDベース技術である。概念上はG1.5に位置付けられるが、実現にはNANDがハードウェア階層の複数段を飛び越える必要があり、技術的障壁は高い。SamsungのzNAND-Oは端末上AI向けで、TLCにより大容量を提供し、先端パッケージングでプロセッサ近傍に配置される。全体としてBernsteinの枠組みは、AIの成長がメモリーとストレージの全スタックにわたる対象市場を拡大する一方、経済的利益はワークロード、階層、実装可能性、技術統合で誰が価値を取得するかにより異なることを示す。
分析フレームワーク
Bernsteinは、主要なAIワークロードを性能ボトルネックとメモリー要件に対応付けた後、メモリーのシステム内での位置に基づくアーキテクチャ階層と、セル構造・記憶機構に基づくハードウェア階層を構築する。遅延、帯域幅、容量、コスト、パッケージング、サプライチェーンへの影響を比較し、各ボトルネックを解決し得る技術を説明している。
手法メモ
AIワークロードとメモリー階層の対応付け
レポートは、ワークロード需要がアクセラレータ、DRAM、NAND、SSD、ストレージ、パッケージング、供給企業へどう波及するかを追跡し、メモリーサプライチェーンの各部分がなぜ恩恵または圧力を受け得るかを示す。
メモリー種類別の性能、容量、コストのトレードオフ
レポートは高速・高コストのメモリーと低コスト・大容量の代替手段を比較し、HBF、CXL、Storage Next、ストレージクラスメモリー製品の論理を説明する。
資産マッピングと比較
投資テーゼから固有資産への構造化マッピング(強み、弱み、同業、リスク)。
- Samsung Electronics (005930.KS)カバー対象のメモリー供給企業。レポートはzHBM、Z-NAND、CXLメモリー製品を論じる。
- 強み
- 新興AIメモリー階層におけるzHBM、CMM-H、Z-NAND/Z-SSDの開発。
- 弱み
- BernsteinはzHBMの熱管理、ハイブリッドボンディングの歩留まり、コスト準備度に疑問を示す。
- 比較
- 他のHBM・DRAM供給企業と競合し、NVHBMはベースダイの差別化を弱める可能性がある。
- リスク
- zHBMの商用化準備度と技術スケーリング要件。
- SK hynix (000660.KS)カバー対象のメモリー供給企業であり、HBFの共同主導企業。
- 強み
- HBMに参画し、SanDiskとともにHBFを主導。
- 比較
- HBFは、より低コストで大容量のNANDを使ってHBMを補完することを目指す。
- リスク
- HBFにはNANDの大幅な性能向上が必要となる。
- Micron (MU)カバー対象のメモリー供給企業。pSLCベースのXTR SSDとDRAMモジュール技術で言及される。
- 強み
- 先進DRAMとNANDベースSSDの取り組みに参加。
- 比較
- AIメモリーでSamsungおよびSK hynixと競合し、NVHBMはベースダイの差別化を標準化する可能性がある。
- リスク
- NVHBMでは、メモリー供給企業の価値がNVIDIAとファウンドリーへ移る可能性がある。
- KIOXIA (285A.JP)カバー対象のNAND・SSD供給企業。GPシリーズSSDはStorage NextとXL-FLASHの例示。
- 強み
- XL-FLASHはストレージクラスメモリー用途向けの高IOPS SSD製品を支える。
- 比較
- SLC/MLCベースの手法は高速階層を狙い、TLCとQLCはCMXおよび容量重視のストレージに対応する。
- リスク
- 製品経済性には、容量・コストと高性能セルモードのトレードオフが伴う。
- SanDisk (SNDK)カバー対象のストレージ供給企業であり、HBFの共同主導企業。
- 強み
- SK hynixとともにHBFを主導し、HBMより高い容量と低いビット当たりコストを目指す。
- 比較
- HBFはHBMと下位のNANDストレージの間に位置付けられる。
- リスク
- レポートは、十分なHBF性能の実現には高い技術的障壁があるとする。
- Seagate (STX)カバー対象のストレージ供給企業で、共有ストレージ需要に関連する。
- 強み
- HDDはコールドデータ向けの低コスト選択肢であり、KVキャッシュのオーバーフローからも恩恵を受け得る。
- 弱み
- HDDは即時のクリティカルパス外にあり、フラッシュメモリーより大幅に遅い。
- 比較
- G4共有ストレージで大容量SSDおよびテープと競合する。
- リスク
- その役割は、遅延感応型ワークロードではなく低コスト容量の需要に依存する。
- Western Digital (WDC)カバー対象のストレージ供給企業で、SSDと共有ストレージ需要に関連する。
- 強み
- フラッシュと各ストレージ階層にわたるAIデータストレージ需要の拡大にエクスポージャーを持つ。
- 比較
- ストレージ技術は遅延、IOPS、耐久性、容量、コストで差別化される。
主要データ
- 理想的なチャットボットTTFT0.5 second or lowerBernsteinはこれを理想的な最初のtokenまでの時間として引用する。
- 許容可能なチャットボットTTFT1 secondTTFTが2秒を超えると、ユーザーの不満やプロンプト放棄につながる可能性がある。
- テキストチャットTPOT50ms, or 20 tokens per secondテキストチャットで許容され得る出力速度。
- 高性能用途TPOTLess than 10msリアルタイム音声、コーディング、エージェント型ワークロードに関連する。
- KIOXIA GPシリーズSSD性能Up to 10M IOPS this year and 100M+ in 2027XL-FLASHベースの高IOPSストレージクラスメモリーの位置付けとして引用。
- Qualcomm HBCロードマップGen-1 in fiscal 2027; Gen-2 in 2028性能を妥協する一方で低コストを狙うLPDDRベースの代替案。
- Intel ZAM目標FY2029熱を考慮したDRAMパッケージング概念の実用化目標。
影響と示唆
レポートは、AIインフラ需要がHBMにとどまらないことを示す。デコード段階のKVキャッシュ、RAGデータベース、エージェント型ワークフローは、DRAM、SSD、HDD、テープ、メモリープーリング、新たな中間階層の役割を生む。また、システムアーキテクチャと統合の選択は、メモリー製造企業、GPU設計企業、ファウンドリー、パッケージング企業、ストレージ供給企業の間で価値を再配分し得る。
リスク
- HBFはHBMを補完するためにNANDの大幅な性能向上を要し、高い技術的障壁に直面する。
- zHBMは商用生産前に、熱、ハイブリッドボンディングの歩留まり、コストの課題に直面する可能性がある。
- PIMはプロセッサ、ソフトウェア、ネットワーク、サプライチェーン全般の変更を要するため、採用が限定的である。
- 3D DRAMは技術的難度が高く、商用化までなお数年を要する。
- NVHBMはメモリー供給企業のベースダイ設計における差別化と価値取得を減らす可能性がある。
注目点
- コンテキストウィンドウと同時ユーザー数の増加に伴う、モデル重みに対するKVキャッシュの成長。
- HBM容量を手頃なコストで拡張できるか、またはワークロードがDRAM、NAND、新たな中間階層へ移るか。
- CXL、Storage Next、CMX、GPUダイレクトストレージ実装の進展。
- HBF、zHBM、NVHBM、XBM、ZAM、HBCの商用化実行。
- XL-FLASH、Z-NAND、pSLC製品など高IOPS NAND技術の採用。