보고서 해설
월가 주요 투자은행의 최신 리서치 커버
리서치 보고서 해설Hilo Research

Global AI memory 리서치 보고서 해설

Bernstein은 학습, 추론, RAG, 에이전틱 워크플로가 서로 다른 메모리 병목을 만들고 더 폭넓은 AI 메모리 기술 계층을 촉진한다고 설명한다. 보고서는 KV 캐시 집약적 추론을 용량, 대역폭, 저비용 메모리 혁신의 주요 촉매로 강조한다.

기관Bernstein
날짜20260828
업종AI memory and semiconductor memory

요약

Bernstein은 학습, 추론, RAG, 에이전틱 워크플로가 서로 다른 메모리 병목을 만들고 더 폭넓은 AI 메모리 기술 계층을 촉진한다고 설명한다. 보고서는 KV 캐시 집약적 추론을 용량, 대역폭, 저비용 메모리 혁신의 주요 촉매로 강조한다.

Samsung Electronics, SK hynix, Micron, SanDisk, Seagate, Western Digital: Outperform; KIOXIA: Underperform.
AI 메모리HBMDRAMNANDKV 캐시AI 추론CXLStorage NextHBF반도체
  • 학습에는 모든 메모리 계층이 필요하다. HBM은 대역폭에 중요하고, DRAM·SSD·네트워크 스토리지는 데이터셋, 스테이징, 체크포인트에 필요하다.
  • 추론 프리필은 연산 제약을 받지만, 디코드는 KV 캐시가 token 수와 동시 사용자 수 모두에 따라 증가하므로 메모리 제약을 받는다.
  • 보고서는 온칩 SRAM에서 HBM, 시스템 메모리, CXL, Storage Next, 로컬 SSD, CMX, 공유 스토리지까지의 아키텍처 계층을 정리한다.
  • HBF는 NAND의 용량과 저비용을 HBM급 대역폭과 결합하려 하지만, Bernstein은 필요한 성능 도약이 기술적으로 어렵다고 본다.
  • 새로운 아키텍처는 메모리 공급업체, GPU 설계업체, 파운드리, 패키징업체, 스토리지 공급업체 간 가치를 재배분할 수 있다.

보고서 해설

개요

이 프라이머는 AI 메모리 수요와 그 과제에 대응하는 기술을 이해하기 위한 프레임워크를 제시한다. Bernstein은 AI가 단일 메모리 시장을 만드는 것이 아니라, 워크로드와 데이터 위치에 따라 고대역폭, 저지연, 용량, 비용, 공유 접근 중 무엇이 중요한지가 결정된다고 주장한다.

핵심 견해

Bernstein의 출발점은 AI 워크로드마다 메모리 요구가 다르다는 점이다. 학습은 연산 집약적이고 흔히 대역폭 제약을 받으므로 HBM이 중요하다. 그러나 대규모 학습 데이터셋은 더 느리고 저렴한 스토리지에 준비·저장한 뒤 HBM으로 옮기기 전에 더 빠른 계층에서 캐시 및 스테이징해야 한다. 학습은 수개월 지속될 수 있어 하드웨어나 소프트웨어 장애 시 처음부터 재시작하지 않도록 체크포인트가 필요하다. 따라서 시스템 DRAM, 로컬 SSD, 네트워크 스토리지는 HBM의 대체재가 아니라 HBM과 함께 필수적이다. Transformer 추론에서 보고서는 프리필과 디코드를 구분한다. 프리필은 프롬프트를 처리해 첫 token을 생성하며 대규모 행렬-행렬 연산을 수행하므로 일반적으로 연산 제약을 받는다. 따라서 가속기 성능과 HBM이 상대적으로 더 중요하다. 핵심 지표인 TTFT는 챗봇에서 약 0.5초 이하가 이상적이고 1초가 허용 가능하며, 2초 초과는 큰 작업에는 용인될 수 있지만 많은 경우 사용자 불만이나 프롬프트 이탈로 이어질 수 있다고 설명한다. 디코드는 token을 자기회귀적으로 생성한다. 재계산을 피하기 위해 이전 token을 키-값 쌍으로 보관하므로 KV 캐시 요구량은 token 수에 비례해 늘어난다. 읽기 전용 모델 가중치와 달리 KV 캐시는 token마다 갱신되고 사용자별로 달라지며 동시 사용자 수와 함께 증가한다. Bernstein은 이 때문에 디코드를 메모리 제약 단계로 본다. 컨텍스트 길이와 동시 사용자 수의 복합적 증가는 KV 캐시가 모델 가중치보다 커지게 하고, 컨텍스트 윈도우와 사용자 수용량을 제한하며, AI 배포의 규모와 수익 규모를 결정할 수 있다. 관련 성능 지표는 TPOT이며, 텍스트 채팅에는 50ms, 즉 초당20 token까지 허용될 수 있지만, 실시간 음성·코딩·에이전틱 작업에는 10ms 미만이 필요하다. RAG는 다른 스토리지 특성을 만든다. 데이터베이스 생성은 대량의 문서, 코드, 웹페이지를 벡터 데이터베이스와 검색 인덱스로 정리하는 과정으로, 대용량 스토리지와 인덱스 생성을 위한 많은 시스템 DRAM이 필요하며 HBM의 중요도는 상대적으로 낮다. 이는 사용자 수나 token 수와 무관한 오프라인 일회성 비용이다. 검색에서는 쿼리 벡터화에 HBM을 빠르게 쓸 수 있지만, 최근접 일치 탐색에는 일반적으로 HBM이나 SSD보다 시스템 DRAM이 더 중요하다. 검색된 데이터는 이후 일반적인 프리필·디코드 추론 경로로 돌아간다. 에이전틱 워크플로는 반복적 계획, 도구, 외부 환경, 중간 상태 보존을 수반해 이러한 요구를 더 키운다. CPU와 기존 서버 메모리 수요도 늘어나며, 에이전트 간 전달되는 결과물은 추가 프리필, 디코드, KV 캐시 부하를 반복적으로 발생시킨다. 보고서는 이를 아키텍처 메모리 계층으로 구성한다. 최상단 G0 메모리는 대개 가속기에 내장된 SRAM으로, 즉각적이고 지연시간에 민감한 연산에 쓰인다. G1 HBM은 그 아래에서 가속기와 함께 패키징돼 높은 대역폭과 낮은 지연시간을 제공한다. G2 시스템 메모리는 CPU가 관리하는 더 큰 용량의 느린 DRAM이지만 일부 GPU는 직접 접근할 수 있다. CXL은 물리적으로 분리된 메모리를 논리적 공통 풀로 묶고, 캐시를 통해 DRAM과 유사해진 NAND 제품까지 확장할 수 있어 G2.5로 분류된다. NVIDIA의 Storage Next는 G2.6으로, GPU 중심 메모리 관리로 NAND의 저비용·대용량과 DRAM에 가까운 지연시간, IOPS, 작은 데이터 접근 단위를 결합하려 하며, 흔히 DRAM/SRAM과 NAND 하이브리드를 사용한다. 그 아래 G3 로컬 SSD는 노드 내부 용량을 확장하지만 pod 간 공유는 불가능하다. G3.5 CMX는 NVIDIA의 KV 캐시용 컨텍스트 스토리지 계층이다. CMX 호환 SSD는 데이터 노드에 위치하며 Ethernet, Spectrum-X 스위치, BlueField-4 DPU를 통해 여러 컴퓨팅 노드가 접근할 수 있고 GPU는 CPU 없이 접근할 수 있다. Bernstein은 STX를 호환 CMX 스토리지 및 ODM 솔루션 통합을 위한 NVIDIA의 참조 아키텍처로 설명한다. G4 공유 스토리지는 SSD, HDD, 테이프로 구성되며 즉각적 핵심 경로 밖의 영속 데이터를 위한 것이다. HDD는 저비용·저빈도 접근 콜드 데이터에 적합하고 확대되는 데이터 저장 및 KV 캐시 오버플로 수요의 수혜를 본다. NAND와 HDD만으로 수요를 충족하지 못하면 테이프 수요도 증가할 수 있다. 하드웨어 계층은 이들 계층의 비용, 지연시간, 기술적 절충을 설명한다. SRAM은 DRAM보다 빠르지만 더 많은 실리콘 면적을 필요로 하며, 보통 로직 다이에 내장돼 캐시로 사용된다. L1은 연산 회로와 가장 가깝고 용량은 가장 작다. 임베디드 DRAM은 더 큰 캐시에서 SRAM과 경쟁할 수 있지만 시장 점유율은 작다. HBM은 DRAM의 한 종류로 기존 DRAM과 웨이퍼 용량을 공유하며, 기존 DRAM은 시스템 메모리와 CXL 계층에도 쓰일 수 있다. Bernstein은 DRAM 기술 진화가 여전히 주로 리소그래피 축소에 의해 이뤄지고 첨단 DRAM에는 EUV가 필요하다고 본다. 중국의 EUV 부재는 CXMT의 장기 경쟁 제약으로 제시된다. 4F² DRAM은 주변 회로를 옮기는 일회성 밀도 개선인 반면, 3D DRAM은 더 긴 확장 경로를 제공할 수 있지만 기술적으로 더 어렵고 상용화까지 수년이 남았다. 여러 혁신은 고성능 메모리를 개선하려 하지만 각기 다른 실행 위험이 있다. Samsung의 zHBM은 HBM을 가속기 위에 배치해 연결을 단축하지만, Bernstein은 DRAM이 프로세서 열을 견딜 수 있는지, 하이브리드 본딩의 수율과 비용이 상업 생산에 준비됐는지 의문을 제기한다. NVIDIA의 NVHBM은 메모리 컨트롤러 기능을 NVIDIA 설계 베이스 다이로 옮겨 가속기 비용을 낮추거나 연산 회로 면적을 확보하고, 대역폭과 전력 효율을 개선할 수 있다. 다만 Bernstein은 이것이 메모리 공급업체의 베이스 다이 차별화 일부를 표준화하고 제조 가치를 가장 가능성 높은 TSMC 같은 파운드리로 옮긴다고 본다. Intel의 XBM은 로직과 공존할 수 있고 PIM 후보가 될 수 있는 신흥 후공정 DRAM 개념이지만, 제조 호환성과 최종 생산자는 불확실하다. Intel의 ZAM은 DRAM 다이를 옆으로 배열해 열 방출을 개선하며 실용화 목표는 FY2029지만, 재배열된 다이 간 무선 데이터 전송이 과제다. Qualcomm의 HBC는 CoWoS와 인터포저 비용을 피하기 위해 HBM보다 낮은 성능을 감수하고 LPDDR로 전력 소비를 낮춘다. Qualcomm은 1세대를 2027 회계연도, 2세대를 2028년에 출하하는 것을 목표로 한다. MRDIMM, SOCAMM2, LPCAMM2 같은 모듈 혁신은 시스템 메모리 성능 향상을 목표로 한다. MRDIMM은 대역폭을 높이기 위해 인터페이스 칩을 추가한다. SOCAMM2는 LPDDR, 128-bit 데이터 버스, 낮은 프로파일을 사용해 전력 소비를 낮추고 모듈당 대역폭을 높이며 AI 서버의 공기 흐름을 개선한다. PIM은 로직과 메모리를 결합해 컴퓨터의 핵심 병목인 데이터 이동을 줄이지만, 처리와 메모리를 분리하는 현행 주류 아키텍처와 근본적으로 다르다. 프로세서, 소프트웨어, 네트워크 및 확립된 로직·메모리 공급망 전반의 변경이 필요해 채택은 매우 제한적이다. 스토리지 클래스 메모리에서 Bernstein은 이를 DRAM과 NAND 사이에 둔다. MRAM, PCM, RRAM은 DRAM·NAND와 근본적으로 다른 메커니즘을 사용하며, 향상된 NAND 접근법은 캐싱 또는 셀 모드 절충을 통해 더 높은 IOPS, 낮은 지연시간, 더 작은 접근 단위를 추구한다. KIOXIA의 XL-FLASH는 SLC와 이후 MLC를 사용해 고IOPS GP 시리즈 SSD를 지원하며, 보고서는 올해 10M IOPS와 2027년 100M+를 언급한다. Samsung의 Z-NAND/Z-SSD도 초저지연을 목표로 한다. Bernstein은 SLC/MLC 기반 제품을 Storage Next 유형 활용처에, TLC를 성능과 비용 균형의 CMX 제품에, QLC를 HDD와 경쟁하는 대용량 제품에 연결한다. Micron의 XTR SSD는 pSLC 사례로, TLC 가능 셀 일부에 1 bit만 저장해 SLC 같은 내구성과 속도를 확보한다. SanDisk와 SK hynix가 주도하는 HBF는 NAND의 더 큰 용량과 낮은 비트당 비용으로 HBM을 보완하면서 HBM 수준 대역폭을 목표로 하는 핵심 NAND 기반 기술이다. 개념상 G1.5 계층에 놓이지만, 이를 달성하려면 NAND가 하드웨어 계층의 여러 단계를 뛰어넘어야 하므로 기술 장벽이 높다. Samsung의 zNAND-O는 온디바이스 AI를 겨냥하며 TLC로 대용량을 제공하고 첨단 패키징을 통해 프로세서 가까이에 배치된다. 전반적으로 Bernstein의 프레임워크는 AI 성장이 메모리·스토리지 전체 스택의 시장 기회를 확대하는 반면, 경제적 이익은 워크로드, 계층, 실행 가능성 및 기술 통합에서 누가 가치를 확보하는지에 따라 달라짐을 시사한다.

분석 프레임워크

Bernstein은 먼저 주요 AI 워크로드를 성능 병목과 메모리 요구 사항에 연결한 뒤, 시스템 내 메모리 위치에 따른 아키텍처 계층과 셀 구조·저장 메커니즘에 따른 하드웨어 계층을 제시한다. 지연시간, 대역폭, 용량, 비용, 패키징, 공급망 영향을 비교해 각 병목을 해결할 수 있는 기술을 설명한다.

방법론 메모

  • 산업 분석 프레임워크산업 가치사슬 상·중·하류 전이

    AI 워크로드와 메모리 계층 매핑

    보고서는 워크로드 수요가 가속기, DRAM, NAND, SSD, 스토리지, 패키징, 공급업체로 어떻게 이어지는지 추적해 메모리 공급망의 각 부분이 수혜 또는 압력을 받을 수 있는 이유를 보여준다.

  • 산업 분석 프레임워크비용곡선 분석

    메모리 유형별 성능·용량·비용의 절충

    보고서는 고속·고비용 메모리와 저비용·대용량 대안을 비교해 HBF, CXL, Storage Next, 스토리지 클래스 메모리 제품의 논리를 설명한다.

자산 매핑 및 비교

투자 논리에서 명시된 자산으로의 구조화 매핑(강점, 약점, 비교 대상, 위험).

  • Samsung Electronics (005930.KS)
    커버 대상 메모리 공급업체이며, 보고서는 zHBM, Z-NAND, CXL 메모리 제품을 논의한다.
    강점
    신흥 AI 메모리 계층에서 zHBM, CMM-H, Z-NAND/Z-SSD를 개발하고 있다.
    약점
    Bernstein은 zHBM의 열 관리, 하이브리드 본딩 수율 및 비용 준비도에 의문을 제기한다.
    비교
    다른 HBM 및 DRAM 공급업체와 경쟁하며, NVHBM은 베이스 다이 차별화를 약화시킬 수 있다.
    위험
    zHBM의 상용화 준비도와 기술 확장 요건.
  • SK hynix (000660.KS)
    커버 대상 메모리 공급업체이자 HBF 공동 주도업체이다.
    강점
    HBM에 참여하고 SanDisk와 함께 HBF를 주도한다.
    비교
    HBF는 더 낮은 비용과 더 큰 용량의 NAND를 사용해 HBM을 보완하는 것을 목표로 한다.
    위험
    HBF에는 NAND의 큰 성능 도약이 필요하다.
  • Micron (MU)
    커버 대상 메모리 공급업체이며, pSLC 기반 XTR SSD 및 DRAM 모듈 기술로 언급된다.
    강점
    첨단 DRAM 및 NAND 기반 SSD 접근법에 참여한다.
    비교
    AI 메모리에서 Samsung 및 SK hynix와 경쟁하며, NVHBM은 베이스 다이 차별화를 표준화할 수 있다.
    위험
    NVHBM에서는 메모리 공급업체의 가치가 NVIDIA와 파운드리로 이전될 수 있다.
  • KIOXIA (285A.JP)
    커버 대상 NAND 및 SSD 공급업체이며, GP 시리즈 SSD가 Storage Next와 XL-FLASH를 보여준다.
    강점
    XL-FLASH는 스토리지 클래스 메모리 용도의 고IOPS SSD 제품을 지원한다.
    비교
    SLC/MLC 기반 접근법은 더 빠른 계층을 겨냥하며, TLC와 QLC는 각각 CMX 및 용량 중심 스토리지를 담당한다.
    위험
    제품 경제성에는 용량·비용과 고성능 셀 모드 간의 절충이 필요하다.
  • SanDisk (SNDK)
    커버 대상 스토리지 공급업체이자 HBF 공동 주도업체이다.
    강점
    SK hynix와 함께 HBF를 주도하며 HBM보다 높은 용량과 낮은 비트당 비용을 목표로 한다.
    비교
    HBF는 HBM과 하위 NAND 스토리지 사이에 위치한다.
    위험
    보고서는 충분한 HBF 성능 달성에 높은 기술 장벽이 있다고 본다.
  • Seagate (STX)
    커버 대상 스토리지 공급업체로 공유 스토리지 수요와 연관된다.
    강점
    HDD는 콜드 데이터용 저비용 선택지로 남아 있으며 KV 캐시 오버플로의 수혜를 받을 수 있다.
    약점
    HDD는 즉각적인 핵심 경로 밖에 있으며 플래시 메모리보다 훨씬 느리다.
    비교
    G4 공유 스토리지에서 대용량 SSD 및 테이프와 경쟁한다.
    위험
    역할은 지연시간 민감 워크로드가 아닌 저비용 용량 수요에 달려 있다.
  • Western Digital (WDC)
    커버 대상 스토리지 공급업체로 SSD 및 공유 스토리지 수요와 연관된다.
    강점
    플래시와 스토리지 계층 전반의 AI 데이터 저장 수요 확대에 노출되어 있다.
    비교
    스토리지 기술은 지연시간, IOPS, 내구성, 용량 및 비용으로 차별화된다.

핵심 데이터

  • 이상적인 챗봇 TTFT0.5 second or lowerBernstein은 이를 이상적인 첫 token 도달 시간으로 인용한다.
  • 허용 가능한 챗봇 TTFT1 secondTTFT가 2초를 초과하면 사용자 불만이나 프롬프트 이탈이 발생할 수 있다.
  • 텍스트 채팅 TPOT50ms, or 20 tokens per second텍스트 채팅에서 허용될 수 있는 출력 속도이다.
  • 고성능 용도 TPOTLess than 10ms실시간 음성, 코딩, 에이전틱 워크로드와 관련된다.
  • KIOXIA GP 시리즈 SSD 성능Up to 10M IOPS this year and 100M+ in 2027XL-FLASH 기반 고IOPS 스토리지 클래스 메모리 포지셔닝 사례로 인용된다.
  • Qualcomm HBC 로드맵Gen-1 in fiscal 2027; Gen-2 in 2028HBM 대비 성능을 절충하는 대신 저비용을 목표로 하는 LPDDR 기반 대안이다.
  • Intel ZAM 목표FY2029열을 고려한 DRAM 패키징 개념의 실용화 목표이다.

영향과 시사점

보고서는 AI 인프라 수요가 HBM에 그치지 않는다고 본다. 디코드 단계의 KV 캐시, RAG 데이터베이스, 에이전틱 워크플로는 DRAM, SSD, HDD, 테이프, 메모리 풀링, 새로운 중간 계층의 역할을 만든다. 또한 시스템 아키텍처와 통합 방식은 메모리 제조업체, GPU 설계업체, 파운드리, 패키징 제공업체, 스토리지 공급업체 사이에서 가치를 재배분할 수 있다.

위험

  • HBF는 HBM을 보완하기 위해 NAND의 큰 성능 도약이 필요하므로 높은 기술 장벽에 직면한다.
  • zHBM은 상업 생산 전에 열, 하이브리드 본딩 수율 및 비용 과제에 직면할 수 있다.
  • PIM은 프로세서, 소프트웨어, 네트워크, 공급망 전반의 변경이 필요해 채택이 제한적이다.
  • 3D DRAM은 기술적으로 더 어렵고 상용화까지 수년이 남았다.
  • NVHBM은 메모리 공급업체 베이스 다이 설계의 차별화와 가치 확보를 줄일 수 있다.

주시할 점

  • 컨텍스트 윈도우와 동시 사용자 수 증가에 따른 모델 가중치 대비 KV 캐시 성장.
  • HBM 용량을 합리적 비용으로 확장할 수 있는지, 또는 워크로드가 DRAM, NAND, 새로운 중간 계층으로 이동하는지.
  • CXL, Storage Next, CMX, GPU 직접 스토리지 구현의 진전.
  • HBF, zHBM, NVHBM, XBM, ZAM, HBC의 상업화 실행.
  • XL-FLASH, Z-NAND, pSLC 제품 같은 고IOPS NAND 기술의 채택.
저장 ICP 제2022035445-5호
면책 고지: 이 웹사이트가 제공하는 시장 데이터, 차트, 지표, 리서치 견해 및 기타 정보는 오직 정보 표시, 리서치 소통, 교육적 참고를 위한 것입니다. 개인화된 투자 자문, 증권 추천, 거래 지시, 권유, 수익 보장으로 간주해서는 안 됩니다. 데이터와 콘텐츠의 신뢰성을 높이기 위해 노력하지만 출처 차이, 방법론적 한계, 시스템 처리, 시장 변동으로 지연, 오류, 불완전, 업데이트 지연이 발생할 수 있습니다. 사용자는 자신의 상황에 따라 독립적으로 판단하고 이 웹사이트 사용에 따른 모든 위험과 책임을 부담해야 합니다.

설정

최근 로그인을 보려면 로그인하세요