보고서 해설
월가 주요 투자은행의 최신 리서치 커버
리서치 보고서 해설Hilo Research

반도체 메모리 및 AI 컴퓨팅 아키텍처: HBM 베이스 다이는 인터페이스 계층에서 제어, 확장 및 니어메모리 컴퓨팅을 위한 AI 시스템 플랫폼으로 진화할 것이다

이 보고서는 3단계 진화 로드맵을 제시한다. 먼저 첨단 로직 공정과 소형 D2D 인터페이스를 사용해 xPU 면적을 확보하고, 다음으로 베이스 다이에 RAS, 외부 메모리 확장 및 처리 유닛을 추가하며, 마지막으로 zHBM을 통해 xPU와 DRAM 스택의 수직 3D 통합을 달성한다.

기관삼성 메모리 사업부
기업HBM 베이스 다이 아키텍처
업종반도체 메모리 및 AI 컴퓨팅 아키텍처

요약

이 보고서는 3단계 진화 로드맵을 제시한다. 먼저 첨단 로직 공정과 소형 D2D 인터페이스를 사용해 xPU 면적을 확보하고, 다음으로 베이스 다이에 RAS, 외부 메모리 확장 및 처리 유닛을 추가하며, 마지막으로 zHBM을 통해 xPU와 DRAM 스택의 수직 3D 통합을 달성한다.

증권 등급, 목표주가 또는 현재 가격은 제공되지 않음
HBM베이스 다이커스텀 HBM첨단 로직 공정AI 가속기D2D 인터페이스니어메모리 컴퓨팅3D 통합
  • TSV 수와 피치, 그리고 베이스 다이 PHY의 I/O 수 및 속도가 추가 대역폭 확장의 주요 병목이 되었다.
  • HBM4부터 전력 증가를 억제하고 유효 면적을 줄이기 위해 베이스 다이에 첨단 로직 공정을 채택하는 것이 필요하다고 여겨진다.
  • 소형 D2D PHY는 채널을 단축하고 비트당 에너지를 줄이며, xPU에 면적을 되돌려주거나 새로운 베이스 다이 기능에 활용할 수 있게 한다.
  • HPB가 PHY 영역의 50% 이상을 차지하면 피크 온도를 35% 이상 낮출 수 있다.
  • 두 번째 단계에서는 센서, 자체 테스트, 외부 메모리 제어 및 처리 유닛을 베이스 다이에 통합한다.
  • 세 번째 단계의 zHBM은 분산 I/O 및 수직 통합을 통해 기존 HBM PHY, D2D 인터페이스 및 2.5D 인터포저를 제거한다.

보고서 해설

개요

이 보고서는 AI 주도 컴퓨팅 수요 속에서 HBM 베이스 다이의 역할이 어떻게 변화하고 있는지를 논의한다. 핵심 관점은 대역폭, 전력, 면적 및 용량 제약이 첨단 로직 공정을 활용하는 표준 HBM에서 커스텀 HBM으로의 전환을 이끌 것이며, 이는 “xPU 면적 확보—기능 확장—3D 통합”의 3단계 진화를 따른다는 것이다.

핵심 견해

보고서는 먼저 HBM 스택에서 코어 다이와 베이스 다이를 구분한다. 코어 다이는 DRAM 셀, 코어 로직 및 TSV를 포함하는 반면, 베이스 다이는 컴퓨팅 다이와의 통신을 위한 PHY-TSV 경로와 DA, MBIST, IEEE 1500 같은 코어 다이 테스트 기능을 제공한다. 더 높은 대역폭이 연속적인 HBM 세대의 주된 동력이 되면서, 기존 아키텍처는 두 가지 직접적인 병목에 직면한다. 첫째, 베이스 다이와 코어 다이 스택의 TSV 수 및 피치 제한이고, 둘째, 베이스 다이 PHY의 I/O 수 및 속도 제한이다. 따라서 보고서는 빠른 대역폭 확장을 위해 베이스 다이의 근본적 변화가 필요하다고 주장한다. 공정 진화는 이 전환의 기반을 제공한다. 보고서에 제시된 로드맵은 베이스 다이가 HBM2부터 HBM3E까지 2*nm에서 1*nm로 이동한 후, HBM4 및 HBM4E에서 4nm 로직 공정으로 전환되는 모습을 보여준다. 같은 기간 xPU SoC는 2016년 16n/12nm에서 HBM4용 3nm, HBM4E용 3nm 미만으로 진화한다. 삼성은 HBM4에 D1c DRAM과 4nm 로직 공정을 사용한다. 보고서는 단위당 에너지 효율이 계속 개선되더라도 총 MPGA 전력 소비는 계속 증가한다고 강조한다. 따라서 HBM4부터 베이스 다이에 첨단 로직 공정을 사용하는 것이 전력 증가를 억제하는 데 중요하다. 이는 또한 유효 면적을 줄이고 베이스 다이와 xPU SoC 간 공정 격차를 축소한다. 이는 DRAM과 첨단 로직 간 진정한 통합의 시작으로 정의된다. 이러한 기반 위에서 보고서는 표준 HBM과 커스텀 HBM을 구분한다. 표준 HBM의 베이스 다이는 주로 기본 데이터 및 테스트 경로를 제공하며, 대부분의 면적은 수동적으로 라우팅에 사용된다. 반면 커스텀 HBM은 표준 코어 다이 스택을 공유하면서 첨단 로직 공정을 사용해 베이스 다이를 맞춤화하고 SoC와 유사한 기능을 부여한다. 그 동기는 기존 xPU 스케일링 방식이 물리적 한계에 접근하고 있기 때문이다. 공정 미세화는 둔화되고, 모놀리식 다이는 레티클 크기 한계에 접근하며, 멀티 칩렛 솔루션의 인터포저 크기도 한계에 가까워지고 있다. 베이스 다이는 이미 첨단 로직 공정을 사용하고 상당한 가용 면적을 보유하므로, 보고서는 일부 xPU 기능을 베이스 다이로 이전할 것을 제안한다. 첫 번째 단계는 xPU 면적 확보와 인터페이스 최적화에 중점을 둔다. 기존 HBM PHY는 베이스 다이에서 가장 큰 기능 영역을 차지하며, HBM2부터 표준 HBM4까지 더 높은 대역폭을 지원하기 위해 그 풋프린트와 채널 길이가 계속 증가했다. 커스텀 HBM은 기존 HBM PHY를 첨단 로직 공정으로 구현된 D2D 인터페이스로 대체한다. 더 작은 인터페이스 풋프린트와 짧은 채널은 pJ/b를 줄이고 에너지 효율을 개선하며 xPU 확장을 위한 귀중한 실리콘 면적을 확보할 수 있다. 보고서는 HBM4부터 HBM5까지를 첨단 로직 공정이 PHY와 D2D 면적을 크게 줄이는 변곡 기간으로 식별한다. 그러나 이 면적 감소는 전력 밀도를 높이고 열 핫스팟을 만든다. 보고서의 비교에 따르면 sHBM4E는 I/O 속도 14Gbps와 전력 밀도 0.5W/mm²를 가지는 반면, sHBM5는 sHBM4E의 약 2배인 28Gbps 초과 I/O 속도와 2.0W/mm² 초과 전력 밀도를 가진다. 이 문제를 해결하기 위해 보고서는 삼성의 cHBM4 경험에 기반한 HPB 열 경로 블록을 제안한다. HPB가 PHY 영역의 50% 이상을 차지하면 피크 온도를 35% 이상 낮출 수 있다. 첫 번째 단계에는 메모리 컨트롤러를 xPU SoC에서 커스텀 HBM 베이스 다이로 이전하는 것도 포함된다. 보고서는 이 배치가 추가 컨트롤러의 열 영향을 관리 가능한 수준으로 유지하면서 xPU 면적을 확보할 수 있기 때문에 메모리 컨트롤러를 최우선 이전 후보로 본다. 기존 HBM 메모리 컨트롤러는 현재 cHBM으로 포팅되고 있다. 컨트롤러가 메모리에 더 가깝게 배치되면, 사용되지 않는 베이스 다이 공간은 미세한 주소 디코딩과 불량 셀 리디렉션을 제공하고 채널 간 수리 용량을 공유하는 SRAM 수리 자원에도 사용될 수 있다. 코어 다이의 제한적이고 유연성이 낮은 행 및 열 수리 자원과 비교할 때, 베이스 다이 SRAM 솔루션은 더 큰 용량과 더 높은 구성 유연성을 제공한다. 두 번째 단계는 메모리 컨트롤러 이전 이후에도 사용 가능한 베이스 다이 면적을 활용해 기능을 추가한다. 첫 번째 범주는 RAS와 테스트다. cHBM은 온도, 전압, 공정 및 노화 센서를 기본적으로 통합해 실시간 고속 텔레메트리를 제공할 수 있다. OD-ATE 및 PGEN 같은 온칩 자체 테스트 메커니즘은 테스트 범위를 확대하고 제조 수율을 개선할 수 있다. 두 번째 범주는 용량 확장이다. 보고서는 AI 모델 컨텍스트 윈도우가 연간 30배 성장하여 KV 캐시 요구사항을 크게 늘리고 있으며, 장기 메모리의 저장 및 검색은 차세대 AI 모델의 주요 병목으로 남아 있다고 지적한다. 따라서 AI SoC는 대역폭뿐 아니라 더 큰 메모리 용량을 시급히 요구한다. 베이스 다이는 외곽 에지를 사용해 외부 메모리에 직접 연결하고 전용 PHY 및 컨트롤러를 통합할 수 있다. 보고서는 이 접근법이 기존 PCIe 확장보다 현저히 높은 대역폭과 낮은 지연 시간을 제공할 수 있다고 주장한다. 두 번째 단계에서는 일부 xPU 연산을 베이스 다이의 처리 유닛으로 이전할 수도 있다. 데이터가 메모리에 더 가까운 곳에서 처리되므로 D2D 대역폭 요구사항, 데이터 이동, 전력 소비 및 열 부담을 줄일 수 있다. 2.5D 시스템 내 첨단 HBM 솔루션에서 베이스 다이 처리 유닛은 인터포저를 가로지르는 데이터 이동도 크게 줄여 시스템 수준 에너지 효율을 개선할 수 있다. 그러나 이 접근법은 베이스 다이의 제한된 실리콘 면적과 처리 유닛이 유발하는 국부 열 밀도 증가에 의해 제약된다. 따라서 기능 규모는 컴퓨팅 이점, 면적 및 방열 간 균형을 맞춰야 한다. 세 번째 단계는 zHBM으로 대표되는 진정한 3D 통합이다. 보고서는 AI 메모리 아키텍처가 빠르게 긴밀한 결합으로 이동하고 있으며, AGI 및 추론 시나리오에서 핵심 목표는 엄격한 전력 제약 아래 대역폭과 TPS를 높이는 것이라고 주장한다. zHBM은 xPU를 코어 다이 스택과 수직 통합하고 2.5D 인터포저를 제거한다. 분산 I/O는 스택 내 데이터 경로를 단축하는 동시에 기존 HBM PHY나 D2D 인터페이스 같은 2차원 인터페이스를 제거한다. 주요 이점은 I/O 전력 소비의 상당한 감소다. SERDES에서 데이터 정렬과 DQ I/O를 제거하면 불필요한 전력 오버헤드를 없애고, 절감된 전력 및 열 여유를 더 높은 시스템 컴퓨팅 성능으로 전환할 수 있다. 보고서는 시스템 아키텍처 비교의 기준으로 “GPU 1개와 HBM4E 4개” 및 “GPU 1개와 zHBM 4개”를 사용하지만 구체적인 정량 결과는 제공하지 않는다. zHBM 구현은 여전히 핵심 공정 및 공동 설계 역량에 달려 있다. 웨이퍼-투-웨이퍼 본딩과 하이브리드 구리 본딩은 초고밀도 I/O를 제공해야 한다. 보고서에 제시된 공정에는 xPU 또는 중간층과 4개의 코어 다이 층을 웨이퍼 수준에서 본딩하는 과정이 포함된다. 동시에 SoC와 DRAM은 통합 설계 및 검증 플로우를 사용해 공동 아키텍처 설계되어야 한다. 전반적으로 보고서는 첨단 로직 베이스 다이를 진화의 핵심 요소로 본다. 첫 번째 단계는 소형 D2D PHY와 컨트롤러 이전을 통해 xPU 면적을 확보하고, 두 번째 단계는 텔레메트리, 테스트, 용량 확장 및 처리 유닛을 추가하며, 세 번째 단계는 zHBM을 사용해 2차원 및 2.5D 인터페이스를 제거하여 xPU 로직과 DRAM 스택의 직접적인 수직 통합 및 최대 에너지 효율을 달성한다.

분석 프레임워크

보고서는 기존 HBM 코어 다이와 베이스 다이 간 역할 분담에서 출발하여 TSV, PHY, 전력 소비 및 패키지 크기와 관련된 스케일링 병목을 식별한다. 이어 HBM2부터 HBM4E까지의 공정 및 인터페이스 세대 변화를 사용해 첨단 로직 공정 채택의 필요성을 입증한다. 다음으로 면적, 채널 길이, 비트당 에너지, 전력 밀도 및 열 핫스팟의 제약 아래 D2D 인터페이스, HPB, 메모리 컨트롤러 이전, SRAM 수리, RAS 및 테스트, 용량 확장, 니어메모리 컴퓨팅 및 3D 통합을 순차적으로 평가하여 궁극적으로 3단계 아키텍처 로드맵을 구성한다.

방법론 메모

  • (어휘 외 방법론)기타

    3단계 아키텍처 진화 로드맵

    보고서는 기술 간 구현 순서와 의존성을 설명하기 위해 베이스 다이 진화를 xPU 면적 확보, 추가 기능 확장 및 진정한 3D 통합의 세 단계로 구분한다.

  • (어휘 외 방법론)기타

    HBM 세대별 파라미터 비교

    보고서는 HBM2부터 HBM4E까지의 연도와 공정, 그리고 sHBM4E와 sHBM5의 I/O 속도 및 전력 밀도를 비교하여 첨단 로직 공정이 만든 변곡점과 그에 따른 새로운 열 제약을 식별한다.

  • (어휘 외 방법론)기타

    전력, 면적, 대역폭 및 방열 간 시스템 수준 트레이드오프

    보고서는 메모리 칩 자체만 검토하는 대신, 짧아진 인터페이스, 기능 이전 및 수직 통합이 xPU 면적, 데이터 이동, I/O 전력, 국부 열 밀도 및 시스템 성능 여유에 미치는 영향을 동시에 평가한다.

핵심 데이터

  • HBM 공정 진화 타임라인2016 HBM2; 2019 HBM2E; 2021 HBM3; 2023 HBM3E; 2026 HBM4; 2027 HBM4E보고서에 제시된 HBM 세대 및 연도
  • HBM4/4E 베이스 다이 공정4nm베이스 다이 공정은 이전에 HBM2와 HBM3E 사이에서 2*nm에서 1*nm로 진화했다
  • HBM4 코어 다이 공정D1c/1*nm보고서는 삼성이 HBM4에 D1c DRAM과 4nm 로직 베이스 다이를 사용한다고 명시한다
  • xPU SoC 공정 진화2016년 16n/12nm; 2019년 8n/4nm; 2021—2023년 4nm; 2026년 3nm; 2027년 <3nmHBM2부터 HBM4E까지의 로드맵에 대응
  • sHBM4E I/O 속도14GbpssHBM5와의 열 밀도 비교 기준
  • sHBM5 I/O 속도>28GbpssHBM4E의 약 2배
  • PHY 전력 밀도sHBM4E 0.5W/mm²; sHBM5 >2.0W/mm²PHY가 축소되고 가속됨에 따라 열 핫스팟 위험이 증가
  • HPB 피크 온도 감소>35%PHY 커버리지가 >50%일 때
  • AI 컨텍스트 윈도우 성장률30배/년보고서는 이를 KV 캐시 및 메모리 용량 요구사항의 빠른 성장을 설명하는 데 사용한다
  • zHBM 시스템 비교 구성GPU 1개 + HBM4E 4개, GPU 1개 + zHBM 4개와 비교보고서는 이 비교에 대한 구체적인 정량 결과를 제공하지 않는다

영향과 시사점

보고서는 HBM 경쟁의 차원이 대역폭만을 넘어 인터페이스 에너지 효율, xPU 면적 활용, RAS, 테스트, 용량 확장 및 니어메모리 컴퓨팅까지 확장될 것이라고 주장한다. 첨단 로직 베이스 다이는 더 많은 시스템 기능을 DRAM 가까이에 배치할 수 있게 하며, zHBM은 최적화 범위를 개별 메모리 장치에서 xPU, DRAM 및 패키징의 공동 아키텍처 수준으로 더욱 확대한다. 따라서 방열, 초고밀도 본딩 및 통합 설계·검증 역량은 이러한 이점을 실현하는 핵심 제약 요인이 될 것이다.

위험

  • TSV 수와 피치, PHY I/O 수 및 속도, 레티클과 인터포저 크기 관련 물리적 한계가 기존 HBM의 추가 대역폭 확장을 제약할 수 있다.
  • PHY 면적 축소는 전력 밀도를 높이고 열 핫스팟을 만든다. 보고서는 sHBM5 PHY 전력 밀도가 2.0W/mm²를 초과한다고 제시한다.
  • 베이스 다이에 처리 유닛을 배치하는 것은 제한된 가용 실리콘 면적 및 증가하는 국부 열 밀도라는 이중 제약을 받는다.
  • zHBM 구현은 웨이퍼-투-웨이퍼 본딩, 하이브리드 구리 본딩 및 통합 SoC—DRAM 설계·검증 플로우에 달려 있다.

주시할 점

  • HPB가 PHY 커버리지 50% 이상 목표를 달성하고 28Gbps를 초과하는 HBM5 I/O 속도에서 35%를 초과하는 피크 온도 감소를 유지할 수 있는지 모니터링한다.
  • 기존 HBM 메모리 컨트롤러를 cHBM 베이스 다이로 포팅하는 진행 상황을 모니터링한다.
  • 베이스 다이 외부 메모리 확장, 온칩 RAS 센서, 자체 테스트 및 처리 유닛의 실제 통합을 모니터링한다.
  • WoW, 하이브리드 구리 본딩 및 통합 SoC—DRAM 설계·검증 플로우가 zHBM을 어떻게 지원하는지 모니터링한다.

설정

최근 로그인을 보려면 로그인하세요