Global AI memory 리서치 보고서 해설
보고서는 학습, 추론, RAG, 에이전트 워크플로가 HBM, DRAM, SSD, 공유 스토리지를 서로 다르게 조합해 필요로 한다고 주장한다. Decode 단계의 KV-cache 증가는 핵심 메모리 제약으로 제시되며, 새로운 메모리 계층과 아키텍처에 대한 관심을 이끈다.
요약
보고서는 학습, 추론, RAG, 에이전트 워크플로가 HBM, DRAM, SSD, 공유 스토리지를 서로 다르게 조합해 필요로 한다고 주장한다. Decode 단계의 KV-cache 증가는 핵심 메모리 제약으로 제시되며, 새로운 메모리 계층과 아키텍처에 대한 관심을 이끈다.
- 학습은 HBM부터 DRAM, 로컬 SSD, 네트워크 스토리지까지 모든 메모리 계층에 의존한다.
- 추론 prefill은 컴퓨팅 제약적인 반면, decode는 KV-cache 수요가 토큰 및 동시 사용자와 함께 증가해 메모리 제약적이다.
- CXL, Storage Next, CMX는 기존 시스템 메모리·로컬 SSD·공유 스토리지 사이에 새로운 계층을 추가하려 한다.
- HBF, zHBM, NVHBM, PIM, 스토리지 클래스 메모리 같은 신기술은 용량, 대역폭, 지연시간 또는 비용의 상충관계를 해결하려 한다.
보고서 해설
개요
이 입문서는 서로 다른 메모리 기술이 AI 시스템에서 어디에 위치하는지 설명한다. Bernstein은 워크로드별 요구사항과 두 가지 상호보완적 계층, 즉 시스템 내 위치에 따른 아키텍처 계층과 저장 메커니즘 및 패키징에 따른 하드웨어 계층을 중심으로 논의를 구성한다.
핵심 견해
Bernstein은 트랜스포머 기반 대형 언어 모델의 워크로드부터 출발한다. 작업마다 메모리 요구사항이 크게 다르기 때문이다. 학습은 컴퓨팅과 대역폭 집약적이어서 HBM이 모델 크기와 컴퓨팅 속도에 중요하지만, 데이터셋용 저비용 용량, 파이프라인 스테이징용 고속 계층, 그리고 학습이 수개월 걸릴 수 있으므로 체크포인트 저장공간도 필요하다. 따라서 보고서는 시스템 DRAM, 로컬 SSD, 네트워크 스토리지를 HBM의 대체재가 아니라 필수 보완재로 본다. 추론은 prefill과 decode로 나뉜다. Prefill은 프롬프트를 처리하고 첫 토큰을 생성하는 단계로, 대형 행렬 연산이 GPU를 높은 수준으로 사용하게 해 일반적으로 컴퓨팅 제약적이므로 가속기 내부 HBM이 상대적으로 중요하다. 핵심 지연시간 지표는 time to first token(TTFT)이다. 보고서는 챗봇의 경우 약 0.5초 이하가 이상적이고 1초가 허용 가능하다고 제시하며, 2초 초과는 대형 작업을 제외하면 사용자의 불만을 유발할 수 있다고 본다. Decode는 토큰을 자기회귀적으로 생성한다. 재계산을 피하기 위해 모델은 이전 토큰을 KV cache에 보관한다. 모델 가중치는 정적이고 여러 사용자가 공유할 수 있지만 KV cache 데이터는 토큰마다 바뀌고 사용자별로 달라져 토큰 수와 동시 사용자 수에 따라 용량 수요가 증가한다. Bernstein은 이 때문에 decode를 메모리 제약적인 단계로 규정하며, 대규모 배포에서는 KV cache가 모델 가중치보다 커져 컨텍스트 윈도, 동시 처리량, 배포 규모 및 잠재적 매출 규모를 제한할 수 있다고 주장한다. Decode의 핵심 지표는 time per output token(TPOT)이며, 보고서는 텍스트 채팅에 약 50 ms, 실시간 음성·코딩·에이전트 애플리케이션에는 10 ms 미만을 제시한다. RAG는 다른 스토리지 패턴을 더한다. 대규모 비정형 데이터에서 벡터 데이터베이스를 만드는 과정에는 상당한 SSD 또는 HDD 용량과 인덱스 구축용 시스템 DRAM이 필요하며, HBM 사용은 상대적으로 적다. Bernstein은 이를 사용자 수 및 토큰 규모와 무관한 배포 전의 일회성 비용으로 설명한다. 검색 중에는 쿼리를 보통 HBM으로 빠르게 벡터화하지만, 최근접 매칭 작업에서는 일반적으로 시스템 DRAM의 역할이 HBM이나 SSD보다 크다. 검색된 콘텐츠는 이후 통상적인 prefill과 decode로 다시 들어간다. 에이전트 워크플로는 문제를 더 증폭한다. 다단계 에이전트는 계획, 분기, 중간 상태를 위한 메모리를 필요로 하고, 외부 도구 사용 시 기존 CPU와 시스템 메모리 수요를 추가로 만들며, 결과를 이후 추론 단계에 반복 입력해 prefill, decode, KV-cache 수요를 늘린다. 아키텍처 계층은 최상단의 초저지연 온칩 SRAM에서 HBM, 시스템 DRAM, CXL 메모리와 Storage Next를 거쳐 로컬 SSD, CMX, 그리고 공유 SSD/HDD/테이프 스토리지로 이어진다. HBM은 가속기와의 공동 패키징이 활성 가중치와 KV cache에 높은 대역폭과 낮은 지연시간을 제공하므로 온칩 메모리 바로 아래에 놓인다. 시스템 DRAM은 더 큰 용량을 제공하지만 지연시간은 더 길다. CXL은 물리적으로 분리된 메모리를 풀링하기 위한 것이며, DRAM 또는 SRAM 캐싱을 통해 DRAM에 가깝게 만든 NAND 제품까지 확장될 수 있다. Storage Next는 GPU 중심 메모리 관리로 전환하고 NAND의 저비용·대용량을 활용하면서 지연시간, IOPS, 접근 단위를 개선하려는 NVIDIA 주도 노력으로 제시된다. Bernstein은 이를 DDR DRAM과 로컬 SSD 사이에 배치한다. CMX는 여러 컴퓨팅 노드에서 KV cache에 최적화된 SSD 기반 공유 계층이며, NVIDIA의 STX 레퍼런스 아키텍처는 상호운용성을 지원하기 위한 것이다. 로컬 SSD는 노드 수준 용량을 확장하고, 공유 SSD, HDD, 테이프는 내구성이 필요하거나 지연시간 민감도가 낮은 데이터를 처리한다. 하드웨어 계층은 이러한 계층 아래의 기술적 상충관계를 설명한다. SRAM은 지연시간이 가장 낮지만 DRAM보다 더 많은 실리콘 면적이 필요해 온칩 캐시에 적합하다. HBM은 XPU 옆에 패키징된 DRAM이며, 일반 DRAM은 시스템 메모리 역할을 하고 CXL 제품에도 사용될 수 있다. Bernstein은 더 작은 공정 노드를 통한 지속적인 DRAM 스케일링을 강조하고 EUV의 전략적 중요성을 언급하며, 중국의 연구 경로로 4F²와 3D DRAM을 다룬다. 4F²는 일회성 밀도 개선을 제공할 수 있는 반면, 3D DRAM은 더 긴 스케일링 경로를 가질 수 있으나 기술적으로 더 어렵고 상용화까지 수년이 걸릴 수 있다. 보고서는 여러 HBM 및 DRAM 혁신을 검토한다. Samsung의 zHBM은 XPU 상단에 HBM 스택을 올려 연결 길이를 줄이지만, Bernstein은 DRAM이 프로세서 열을 견딜 수 있는지와 하이브리드 본딩의 수율 및 비용이 상용화 준비가 되었는지에 의문을 제기한다. NVIDIA의 NVHBM은 베이스 다이 설계를 NVIDIA로 옮겨 XPU 다이 비용을 낮추고 컴퓨팅 영역을 늘리며 대역폭 개선과 전력 절감을 꾀할 수 있지만, 메모리 공급업체의 차별화를 표준화해 없애고 제조 가치를 파운드리로 이동시킬 수 있다. Intel의 XBM과 ZAM, Qualcomm의 HBC, MRDIMM·SOCAMM2·LPCAMM2를 포함한 모듈 형식은 대역폭, 열 또는 전력 개선을 위한 대안으로 제시된다. HBC는 CoWoS 인터포저를 피해 패키징 비용을 낮추는 대신 일부 성능을 희생하고 LPDDR을 사용하며, Qualcomm은 1세대를 fiscal 2027, 2세대를 2028에 목표로 한다. NAND와 스토리지 클래스 메모리에서 Bernstein은 개선된 NAND 제품을 DRAM과 일반 SSD 사이에 배치한다. Z-NAND와 XL-FLASH는 일부 용량 및 비용 이점을 희생하는 대신 더 낮은 지연시간과 높은 IOPS를 위해 SLC 또는 MLC를 사용한다. KIOXIA의 GP-series SSD는 2026년 최대 10M IOPS, 2027년 100M+ IOPS 사례로 제시된다. 보고서는 SLC/MLC 기반 XL-FLASH를 Storage Next형 애플리케이션에, 비용과 성능의 균형을 이루는 TLC를 CMX 제품에, HDD와 경쟁하는 대용량 제품에는 QLC를 배정한다. SanDisk와 SK hynix가 주도하는 HBF는 NAND의 낮은 비용과 높은 용량으로 HBM을 보완하면서 HBM 대역폭에 접근하려 하지만, Bernstein은 여러 하드웨어 계층을 뛰어넘어야 한다는 기술적 어려움을 강조한다. HDD는 저비용의 비정기 접근 콜드 데이터에 적합하며, 보고서는 KV-cache 오버플로를 포함한 급증하는 스토리지 수요가 HDD에 도움이 된다고 설명한다. NAND와 HDD 공급 부족 속에 테이프 수요도 증가했다는 언급도 있다. 마지막으로 PIM은 데이터 이동이라는 핵심 컴퓨팅 병목을 줄이기 위해 동일한 실리콘에 처리와 메모리를 결합한다. Bernstein은 잠재적 이점을 인정하면서도, PIM이 기존의 처리와 메모리 분리 구조에서 벗어나 프로세서, 소프트웨어, 네트워크, 공급망 전반의 대규모 재설계를 요구하기 때문에 채택이 제한적이었다고 강조한다.
분석 프레임워크
Bernstein은 먼저 AI 워크로드를 컴퓨팅, 대역폭, 용량 또는 지연시간 중 무엇이 제약 요인인지에 따라 분류한다. 이어 시스템 내 위치와 용도에 따른 아키텍처 계층, 그리고 셀 설계·패키징·저장 메커니즘에 따른 하드웨어 계층에 메모리 유형을 배치한다. 이 프레임워크를 통해 기존 및 신흥 기술의 비용, 용량, 대역폭, 지연시간 간 상충관계를 설명한다.
방법론 메모
AI 메모리 아키텍처 및 하드웨어 계층
보고서는 온칩 SRAM부터 HBM, DRAM, SSD, 공유 스토리지까지 메모리를 배치해 AI 메모리 공급망에서 워크로드 수요가 어떻게 전이되는지 보여준다.
워크로드별 메모리 요구사항
분석은 학습, prefill, decode, RAG, 에이전트 워크플로를 구분해 어떤 메모리 자원이 왜 제약되는지 설명한다.
자산 매핑 및 비교
투자 논리에서 명시된 자산으로의 구조화 매핑(강점, 약점, 비교 대상, 위험).
- Samsung Electronics (005930.KS)커버 대상 메모리 공급업체이자 zHBM, CXL 메모리 모듈, Z-NAND 개발사.
- 강점
- 보고서는 zHBM, CMM-H 하이브리드 CXL 메모리, Z-SSD 제품을 강조한다.
- 비교
- zHBM은 HBM 스택을 XPU 상단에 배치해 표준 HBM보다 한 단계 더 나아가려는 시도이다.
- 위험
- Bernstein은 zHBM의 열 성능과 하이브리드 본딩의 수율 및 비용 측면의 상용화 준비도를 의문시한다.
- SK hynix (000660.KS)커버 대상 메모리 공급업체이자 HBF 참여사.
- 강점
- 보고서는 SK hynix를 SanDisk와 함께 HBF 선도 기업으로 지목하고 HBM 사례의 공급업체로 제시한다.
- 비교
- HBF는 더 높은 NAND 기반 용량과 낮은 비용으로 HBM을 보완하려 한다.
- 위험
- HBF는 NAND와 HBM 간의 큰 성능 격차를 극복해야 한다.
- Micron (MU)커버 대상 메모리 공급업체이자 Storage Next 참여사.
- 강점
- 보고서는 Micron의 XTR SSD를 pSLC 사례로 들고, Micron을 Storage Next 협력사에 포함한다.
- 약점
- NVHBM은 메모리 공급업체의 베이스 다이 차별화를 약화시킬 수 있다.
- 비교
- Micron은 Samsung과 함께 표준 HBM의 베이스 다이를 제조하는 공급업체로 언급된다.
- 위험
- NVHBM의 베이스 다이 표준화는 가치가 NVIDIA와 파운드리로 이동하게 할 수 있다.
- KIOXIA (285A.T)커버 대상 NAND 및 SSD 공급업체이며, GP-series SSD는 Storage Next 사례로 사용된다.
- 강점
- XL-FLASH GP-series SSD는 매우 높은 IOPS와 Storage Next 계층에서의 활용 사례로 언급된다.
- 비교
- SLC/MLC 기반 XL-FLASH는 TLC의 밀도 경제성보다 지연시간과 IOPS를 우선한다.
- SanDisk (SNDK)커버 대상 NAND 공급업체이자 HBF 선도사.
- 강점
- 보고서는 SanDisk를 HBF 선도사로 지목하고, HBF 설계로 총 메모리 용량 확대를 설명한다.
- 비교
- HBF는 더 낮은 비용과 더 높은 용량의 NAND를 활용해 HBM을 대체하기보다 보완하려 한다.
- 위험
- HBM 대역폭에 접근하기 위해 필요한 NAND 성능 개선은 높은 기술 장벽이다.
- Seagate (STX)하위 공유 스토리지 계층과 연결된 커버 대상 스토리지 기업.
- 비교
- HDD는 메모리 계층에서 NAND보다 낮게 배치되지만, 저비용 콜드 스토리지로 여전히 유용하다.
- Western Digital (WDC)하위 공유 스토리지 계층과 연결된 커버 대상 스토리지 기업.
- 비교
- 보고서는 HDD를 내구성이 필요하고 지연시간 민감도가 낮은 데이터를 위한 G4 공유 스토리지 옵션으로 설명한다.
핵심 데이터
- 이상적인 챗봇 TTFT0.5 seconds or lower보고서는 이를 첫 토큰 생성 시간의 이상적인 수준으로 제시하며, 1초는 허용 가능하다고 본다.
- 대형 작업에서 허용될 수 있는 TTFTMore than 2 seconds보고서는 100-page PDF를 소화하는 작업 등에서는 허용될 수 있으나, 사용자의 불만을 유발할 수 있다고 설명한다.
- 텍스트 채팅 TPOTUp to 50 ms허용 가능한 토큰당 출력 시간의 예시이다.
- 고사양 TPOTLess than 10 ms실시간 음성, 코딩, 에이전트 워크로드를 위한 예시 요구사항이다.
- KIOXIA GP-series SSD IOPSUp to 10M in 2026; 100M+ in 2027XL-FLASH 기반 고 IOPS 스토리지 사례로 제시된다.
- Qualcomm HBC 일정Gen-1 in fiscal 2027; Gen-2 in 2028보고서가 인용한 회사 목표이다.
영향과 시사점
Bernstein의 프레임워크는 AI 메모리 수요가 HBM에만 국한되지 않음을 시사한다. 컨텍스트 윈도 확대, 동시 사용량, RAG 데이터셋, 에이전트 워크플로는 DRAM, SSD, HDD 및 새로운 중간 계층 전반의 수요를 늘릴 수 있다. 보고서는 각 솔루션의 기술적·상업적 가치는 지연시간, 대역폭, 용량 또는 비용 병목을 어디에서 개선하느냐에 달려 있음을 강조한다.
위험
- HBF는 NAND가 HBM을 보완하기 위해 큰 성능 격차를 넘어야 하므로 높은 기술 장벽에 직면한다.
- zHBM은 상용화 전에 열, 하이브리드 본딩 수율 및 비용 문제에 직면할 수 있다.
- PIM은 프로세서, 소프트웨어, 네트워크, 공급망 아키텍처 전반의 큰 변화를 요구하므로 채택이 제한적이었다.
- 3D DRAM은 기술적으로 어렵고 상용화까지 수년이 걸릴 수 있다.