반도체 메모리 및 첨단 패키징: HBM은 AI 시스템의 메모리 대역폭 상한을 높이며, 첨단 패키징, 열 관리 및 신뢰성이 다음 단계 확장의 핵심 요소로 부상
Micron은 AI 모델의 지속적인 확장으로 메모리 대역폭이 시스템 성능 병목이 되고 있다고 본다. HBM은 높은 병렬성, 넓은 인터페이스 및 3D 적층을 통해 컴퓨팅과 메모리 간 격차를 크게 줄인다. HBM4는 대역폭과 용량을 추가로 높이지만, 더 많은 실리콘 사용량, 패키징 복잡성, 열 관리 및 신뢰성 과제도 초래한다.
요약
Micron은 AI 모델의 지속적인 확장으로 메모리 대역폭이 시스템 성능 병목이 되고 있다고 본다. HBM은 높은 병렬성, 넓은 인터페이스 및 3D 적층을 통해 컴퓨팅과 메모리 간 격차를 크게 줄인다. HBM4는 대역폭과 용량을 추가로 높이지만, 더 많은 실리콘 사용량, 패키징 복잡성, 열 관리 및 신뢰성 과제도 초래한다.
- 루프라인 모델은 HBM이 메모리 대역폭 상한을 높여 메모리 집약적 AI 워크로드가 병목에 도달하기 전 더 높은 성능을 달성할 수 있음을 보여준다.
- 예시 시스템에서 HBM3 스택 8개는 이론적 대역폭 5.3 TB/s를 제공하며, 이는 8채널 DDR5 시스템의 307 GB/s와 비교된다.
- HBM4의 명목 대역폭은 2800 GB/s이며, 채널 수는 32개, 데이터 I/O 수는 2048개로 증가한다.
- HBM3E 용량을 제공하려면 DDR5 대비 약 3배의 실리콘이 소요되며, 이는 설계, 패키징 및 제조 복잡성이 결합된 비용을 반영한다.
- 54일간의 Llama 3 405B 사전학습 기록에서 예기치 않은 중단의 약 78%는 확인되었거나 의심되는 하드웨어 문제에 기인했다.
- 더 높은 D2D 속도, 더 높은 적층, 액체 냉각, 하이브리드 본딩 및 더 큰 인터포저는 후속 확장을 위한 중요한 기술 방향이다.
보고서 해설
개요
이는 Micron이 발행한 AI 메모리 아키텍처 기술 보고서이다. 메모리가 대형 모델과 가속 컴퓨팅의 핵심 제약 요인이 된 이유와 HBM이 고대역폭, 높은 병렬성 및 이기종 통합을 통해 ‘메모리 월’을 완화하는 방식을 설명하는 데 초점을 둔다. 보고서는 HBM1에서 HBM4까지의 진화도 검토하고 고속 인터커넥트, 첨단 패키징, 열 관리 및 신뢰성과 관련된 향후 과제를 논의한다.
핵심 견해
보고서는 대형 모델의 스케일링 법칙으로 시작한다. 언어 모델 성능은 모델 크기, 데이터셋 크기 및 학습 컴퓨팅이 증가함에 따라 꾸준히 개선되지만, 세 요소는 함께 확장되어야 하며 어느 한 요소의 병목도 전체적인 향상을 제한한다. GPU 컴퓨팅 성능이 계속 상승함에 따라 데이터가 프로세서에 충분히 빠르게 도달하지 못해 발생하는 ‘메모리 월’이 점점 더 두드러지고 있다. 따라서 메모리는 보조 구성요소에서 AI 시스템 성능의 지속적 확장 가능성을 결정하는 핵심 요인으로 진화했다. 보고서는 루프라인 모델을 사용해 이러한 제약을 설명한다. 이 모델은 초당 연산 수로 표현되는 달성 가능한 성능과 바이트당 연산 수로 표현되는 연산 집약도를 측정한다. 연산 집약도가 낮은 애플리케이션은 성능이 메모리 대역폭에 의해 결정되는 메모리 바운드 영역에서 작동하는 반면, 연산 집약도가 높은 애플리케이션은 컴퓨팅 역량에 의해 제한될 가능성이 더 높다. HBM은 메모리 대역폭 상한을 높여 메모리 집약적 AI 워크로드가 대역폭 한계에 도달하기 전에 더 높은 성능을 달성하도록 하며, 컴퓨팅 역량과 데이터 전달 역량을 연결하는 ‘컴퓨팅-메모리 브리지’ 역할을 한다. HBM은 다수의 독립 채널, 넓은 I/O, 단거리 점대점 연결 및 3D 적층을 통해 높은 병렬성을 달성한다. 각 DRAM 다이에는 여러 독립 채널이 포함되며, 각 채널에는 명령 및 주소 버스를 공유하지만 독립적인 데이터 버스를 사용하는 두 개의 의사 채널이 있다. 베이스 다이는 호스트와 DRAM 간 명령 및 데이터 인터페이스를 처리하고, 마이크로 범프 PHY는 호스트를 베이스 다이에 연결하며, 3D TSV PHY는 DRAM 스택을 베이스 다이에 연결한다. HBM3E는 다이당 128개 뱅크를 가지며 HBM4에서는 256개로 증가한다. 고밀도 인터포저 연결은 HBM3E의 약 1K I/O에서 HBM4의 약 2K I/O로 증가한다. 세대별 사양은 HBM이 대역폭, 채널 수 및 용량 측면에서 지속적으로 진화하고 있음을 보여준다. HBM1, HBM2, HBM2E, HBM3, HBM3E 및 HBM4의 각각의 이정표는 2014년, 2018년, 2020년, 2022년, 2024년 및 2026년이다. 이들의 채널 수는 각각 8, 8, 8, 16, 16 및 32개이며, 의사 채널 수는 없음, 16, 16, 32, 32 및 64개이고, 의사 채널 폭은 128, 64, 64, 32, 32 및 32비트이다. 버스트 길이는 HBM1의 2에서 HBM2 및 HBM2E의 4로 증가했고, HBM3부터는 8이 되었다. 프리페치 폭은 모든 세대에서 256비트이다. 데이터 I/O 수는 HBM1부터 HBM3E까지 1024개를 유지하다가 HBM4에서 2048개로 증가했다. HBM1부터 HBM4까지의 해당 명목 데이터 전송률은 1, 2.4, 3.6, 6.4, 8 및 11 Gbps이며, 명목 대역폭은 128, 307, 460, 819, 1024 및 2800 GB/s이다. DRAM 밀도는 각각 2, 8, 16, 16, 24 및 24 Gb이다. 스택 높이는 HBM1의 4층에서 HBM2 및 HBM2E의 4/8층, HBM3의 8/12층, HBM3E 및 HBM4의 8층 이상으로 발전했다. 이에 따라 스택당 용량은 1 GB에서 4/8 GB, 8/16 GB 및 16/24 GB로 증가했으며, HBM3E와 HBM4에서는 24 GB 이상에 도달했다. 각 세대는 대역폭, 접근 세분성, 효율 및 용량을 각각 개선하기 위해 데이터 전송률, 의사 채널 수, 밀도 및 스택 높이를 동시에 높인다. 시스템 비교는 HBM의 대역폭 우위를 더욱 보여준다. DDR5 채널 8개를 사용하는 예시 시스템은 채널당 2개의 32비트 서브채널을 갖고 4800 MT/s에서 이론적 대역폭 307 GB/s를 제공한다. 채널당 2개 랭크 및 DIMM당 64 GB를 가정하면 총용량은 1 TB에 이를 수 있다. HBM3 스택 8개로 구성된 또 다른 예시 시스템은 스택당 16개 채널 및 채널당 2개의 32비트 의사 채널을 갖고 5.2 Gbps에서 이론적 대역폭 5.3 TB/s를 제공한다. 스택당 24 GB 기준으로 총용량은 192 GB이다. 두 아키텍처는 서로 다른 우선순위를 반영한다. 기존 DIMM은 더 큰 용량을 제공하는 반면, HBM은 GPU 가까이에 배치되고 병렬 인터페이스를 넓힘으로써 용량을 대가로 시스템 대역폭을 10배 수준으로 높인다. 코어 수준에서 8 Gbps로 동작하는 256개의 I/O는 256 GB/s 대역폭을 제공할 수 있는 반면, 8 Gbps로 동작하는 8개의 I/O는 8 GB/s만 제공한다. 예시 뱅크 수 비교는 128개 대 32개이다. 동시에 HBM 성능에는 자원 비용도 따른다. 아키텍처 설계, 첨단 패키징 및 제조 복잡성의 조합으로 동일한 HBM3E 용량을 제공하려면 DDR5 대비 약 3배의 실리콘이 필요하다. 따라서 HBM 확장은 단순한 DRAM 공정 문제가 아니며, 패키징 기술, I/O 회로, 인터포저 공정 및 CMOS 공정의 조율된 최적화에도 의존한다. 보고서는 AI 메모리 요구사항을 성능, 용량, 확장성 및 저전력의 네 영역으로 요약한다. 성능에는 속도와 대역폭뿐 아니라 신뢰성 및 내결함성도 포함된다. 용량은 모델 파라미터, 파일 및 캐시를 저장하기 위해 필요하다. 저전력은 에너지 효율과 AI 엣지 디바이스 배포에 영향을 미친다. 더 고속의 I/O와 더 큰 시스템 인 패키지 설계가 등장함에 따라, 향후 혁신 방향에는 메모리 최적화 SERDES D2D PHY, 공동 패키징 광학(CPO), 더 큰 CoWoS-L 또는 CoWoS-R 유형 SiP 및 유리 기판이 포함된다. 이러한 기술은 연결성을 확장하고 고속 링크의 손실을 줄이지만, 시스템 공동 설계의 난이도도 높인다. 칩-패키지 상호작용은 또 다른 핵심 과제이다. 복잡한 이기종 통합 HBM 장치는 열팽창계수가 서로 맞지 않는 여러 소재를 사용하며, 이로 인해 열기계적 응력이 발생하여 구조적 무결성과 장기 신뢰성에 영향을 줄 수 있다. 신뢰성, 가용성 및 서비스 가능성 역시 대규모 학습에 직접적인 영향을 미친다. 보고서가 인용한 Llama 3 405B 사전학습 기록은 54일을 다루며, 이 기간 예기치 않은 중단의 약 78%는 확인되었거나 의심되는 하드웨어 문제에 기인했다. 여기에는 고장 GPU 148건(30.1%), GPU HBM3 메모리 72건(17.2%), 소프트웨어 결함 54건(12.9%), 네트워크 스위치 또는 케이블 35건(8.4%), 계획되지 않은 호스트 유지보수 32건(7.6%), GPU SRAM 메모리 19건(4.5%) 및 GPU 시스템 프로세서 17건(4.1%)이 포함됐다. 이러한 데이터는 AI 클러스터 성능이 최대 대역폭뿐 아니라 장기간 운영 중 메모리 및 컴퓨팅 하드웨어의 안정성에도 의존함을 보여준다. 신뢰성 문제를 해결하기 위해 HBM3는 두 수준의 ECC 커버리지를 제공하기 시작했다. 시스템 수준 커버리지는 각 256비트 액세스에 대해 16개의 메타데이터 비트를 제공하여 시스템이 CRC 또는 ECC를 적용할 수 있도록 한다. 다이 수준 커버리지는 DRAM 내부에 심볼 기반 Reed-Solomon ECC를 구현한다. 보고서는 이러한 종단 간 보호가 HBM이 지속적인 학습과 고가용성 컴퓨팅을 지원할 수 있게 하는 중요한 구성요소라고 주장한다. 고속 D2D 인터커넥트, 베이스 다이 기능, DRAM 다이 활동 및 스택 높이가 증가함에 따라 열 관리는 더 어려워질 것이다. 보고서는 액체 냉각과 하이브리드 본딩을 중요한 대응책으로 제시하며, 첨단 패키징은 마이크로 범프, 패드 및 TSV를 포함하는 면적 밀도 I/O 스케일링, 더 미세한 선폭과 간격을 포함하는 횡방향 I/O 스케일링, 어레이 및 CMOS 분할, 핫스팟 및 전력 공급 네트워크 관리를 동시에 발전시켜야 한다고 덧붙인다. 적층 및 본딩 경로에는 CoS, CoW, C2C, C2W, W2W, 마이크로 범프, 퓨전 본딩 및 하이브리드 본딩이 포함되며, 이는 향후 HBM 성능 향상이 메모리, 로직, 패키징, 열 관리 및 제조 생태계 전반의 긴밀한 협력에 의존함을 나타낸다. 보고서는 AI 애플리케이션 확산 속도를 보여주기 위해 ChatGPT가 단 두 달 만에 사용자 1억 명에 도달했다는 점을 언급하며, 이를 바탕으로 산업이 전례 없는 가속 단계에 들어섰음을 강조한다. 핵심 결론은 HBM이 AI 가속 컴퓨팅의 기반 구성요소가 되었지만, 대역폭과 용량의 지속적 증가는 개별 메모리 기술 업그레이드에만 의존할 수 없다는 것이다. 고속 인터커넥트, 패키지 크기, 소재 응력, 열 밀도, 오류 정정 및 시스템 서비스 가능성과 관련된 과제도 병행하여 해결되어야 한다.
분석 프레임워크
보고서는 다음 순서로 전개된다: AI 확장 요구사항, 메모리 병목, HBM 동작 원리, 세대별 사양 진화, 시스템 수준 비교, 패키징 및 인터커넥트, 신뢰성 및 열 관리 과제. 먼저 대형 모델 스케일링 법칙과 루프라인 모델을 사용해 대역폭이 성능을 제한하는 이유를 설명한 뒤, HBM1부터 HBM4까지의 사양 표, DDR5 및 HBM 시스템의 사례, 학습 중단의 근본 원인 데이터를 통해 차이를 정량화한다. 마지막으로 칩, 패키징, 소재, 열 관리 및 오류 정정 관점에서 지속적 확장에 필요한 기술 방향을 제안한다.
방법론 메모
루프라인 성능 모델
이 모델은 달성 가능한 컴퓨팅 성능을 연산 집약도와 연결하며, 워크로드가 메모리 대역폭 또는 컴퓨팅 역량에 의해 제약되는지를 구분하는 데 사용된다. 보고서는 이를 사용해 HBM이 대역폭 상한을 높이고 메모리 집약적 AI 작업의 성능을 개선하는 방식을 설명한다.
대형 모델 스케일링 법칙
보고서는 모델 크기, 데이터셋 크기 및 학습 컴퓨팅이 함께 확장되어야 한다는 경험적 원칙을 인용하여, 메모리가 컴퓨팅 역량과 함께 업그레이드되지 않으면 추가적인 AI 성능 향상의 병목이 되는 방식을 설명한다.
세대별 사양 및 시스템 아키텍처 비교
보고서는 HBM1부터 HBM4까지의 채널, I/O, 전송률, 대역폭, 밀도 및 용량을 비교하고, 8채널 DDR5 시스템과 8스택 HBM3 시스템을 나란히 배치하여 서로 다른 용량 및 대역폭 우선순위를 보여준다.
예기치 않은 중단의 근본 원인 분류
보고서는 장기간의 대형 모델 사전학습 중 발생한 중단을 GPU, HBM3 메모리, 소프트웨어, 네트워크, 호스트 유지보수 및 기타 원인으로 분류하여 하드웨어 신뢰성이 AI 클러스터의 유효 운영 시간에 미치는 영향을 보여준다.
핵심 데이터
- HBM 세대별 타임라인HBM1 2014; HBM2 2018; HBM2E 2020; HBM3 2022; HBM3E 2024; HBM4 2026보고서에 제시된 제품 진화 이정표
- HBM 명목 대역폭128, 307, 460, 819, 1024, 2800 GB/s각각 HBM1, HBM2, HBM2E, HBM3, HBM3E 및 HBM4에 해당
- HBM 명목 데이터 전송률1, 2.4, 3.6, 6.4, 8, 11 Gbps각각 HBM1부터 HBM4에 해당
- HBM4 채널 및 I/O32개 채널, 64개 의사 채널 및 2048개 데이터 I/OHBM3E는 각각 16개 채널, 32개 의사 채널 및 1024개 데이터 I/O를 보유
- DDR5 예시 시스템이론적 대역폭 307 GB/s 및 용량 1 TB8개 채널, 4800 MT/s 및 채널당 2개의 32비트 서브채널; 채널당 2개 랭크 및 DIMM당 64 GB
- HBM3 예시 시스템이론적 대역폭 5.3 TB/s 및 용량 192 GB8개 스택, 5.2 Gbps, 스택당 16개 채널 및 스택당 24 GB 용량
- HBM3E 실리콘 사용량DDR5의 약 3배보고서는 이를 아키텍처 설계, 첨단 패키징 및 제조 복잡성의 결합된 오버헤드에 기인한다고 설명
- 예기치 않은 학습 중단에서 하드웨어가 차지하는 비중약 78%Llama 3 405B 사전학습 54일 동안 확인되었거나 의심되는 하드웨어 문제에 기인
- 주요 중단 범주고장 GPU: 148건, 30.1%; GPU HBM3 메모리: 72건, 17.2%; 소프트웨어 결함: 54건, 12.9%보고서에 제시된 예기치 않은 중단의 상위 3개 근본 원인 범주
- HBM3 시스템 수준 오류 정정 메타데이터각 256비트 액세스에 16개의 메타데이터 비트 구성시스템은 CRC 또는 ECC를 사용할 수 있으며, 다이 수준 Reed-Solomon ECC도 제공됨
- ChatGPT 사용자 채택 속도2개월 만에 사용자 1억 명 도달보고서에서 AI 애플리케이션 채택 속도를 설명하는 데 사용
영향과 시사점
보고서는 AI 시스템 설계가 GPU 최대 컴퓨팅 성능만을 추구하는 방식에서 컴퓨팅, 메모리, 인터커넥트 및 패키징의 조율된 최적화로 전환되고 있다고 주장한다. HBM은 데이터 전달 속도를 크게 높일 수 있지만, 더 높은 대역폭과 용량은 실리콘 사용량, I/O 밀도, 스택 높이 및 열 부하도 증가시킨다. 따라서 향후 성능 확장은 첨단 패키징, 고속 D2D, 액체 냉각, 하이브리드 본딩, ECC 및 산업 간 협력이 함께 발전할 수 있는지에 달려 있다.
위험
- 메모리 대역폭이 모델 크기 및 컴퓨팅 역량과 함께 확장되지 못하면 프로세서는 데이터를 기다리는 동안 컴퓨팅 성능을 충분히 활용할 수 없다.
- HBM 이기종 패키징의 서로 다른 소재 간 열팽창계수 불일치는 열기계적 응력을 생성하여 칩-패키지 상호작용 위험을 초래할 수 있다.
- 고속 인터커넥트, 베이스 다이 기능, DRAM 활동 및 스택 높이의 증가는 열 밀도를 높이고 방열을 더 어렵게 만든다.
- 장기간 AI 학습은 하드웨어 신뢰성에 매우 민감하다. 인용된 54일 학습 기록에서 예기치 않은 중단의 약 78%는 확인되었거나 의심되는 하드웨어 문제와 연관됐다.
- HBM3E 용량에는 DDR5 대비 약 3배의 실리콘이 필요하며, 첨단 설계, 패키징 및 제조 복잡성이 자원 및 생산 과제를 초래한다.
주시할 점
- HBM4의 32개 채널, 64개 의사 채널, 2048개 I/O 및 2800 GB/s 명목 대역폭이 차세대 AI 워크로드를 지원할 수 있는지 여부.
- 메모리 최적화 SERDES D2D PHY, 공동 패키징 광학 및 더 큰 SiP 인터포저의 진전.
- 더 큰 DRAM 활동과 더 높은 스택으로 발생하는 열 관리 문제 해결에서 액체 냉각 및 하이브리드 본딩의 개선 효과.
- 마이크로 범프, TSV, 선폭 및 간격 스케일링, 유리 기판 등 첨단 패키징 기술의 진화.
- 시스템 수준 CRC 또는 ECC 및 다이 수준 Reed-Solomon ECC를 통한 AI 학습 신뢰성 및 서비스 가능성의 개선.