d-Matrix Raptor 3D-DRAM 생성형 추론 가속기: Raptor는 3D-DRAM으로 생성형 추론의 메모리 대역폭 및 에너지 병목을 돌파한다
보고서는 d-Matrix Raptor의 초기 실리콘과 3D-DRAM 코드설계를 소개한다. 카드당 32 GB 용량 및 100 TB/s 대역폭과 함께 스트림 블로킹, 핀리스 DBI, 열 인지 신뢰성 메커니즘을 통해 오버페치, I/O 전력 소비, 고온 리프레시 문제를 해결한다.
요약
보고서는 d-Matrix Raptor의 초기 실리콘과 3D-DRAM 코드설계를 소개한다. 카드당 32 GB 용량 및 100 TB/s 대역폭과 함께 스트림 블로킹, 핀리스 DBI, 열 인지 신뢰성 메커니즘을 통해 오버페치, I/O 전력 소비, 고온 리프레시 문제를 해결한다.
- 모델 가중치와 KV 캐시는 동시에 증가한다. 사용자 64명, 사용자당 컨텍스트 길이 100만인 경우 KV 캐시는 약 935 GB이다.
- Raptor 카드 하나는 8개의 칩렛으로 구성되며, 32 GB 용량과 100 TB/s 대역폭을 제공한다. 72카드 랙은 2.3 TB 및 7.2 PB/s에 이른다.
- 스트림 블로킹은 3뱅크 매핑으로 인한 33% 오버페치를 0%로 줄여 약 33 TB/s의 대역폭을 회수한다.
- 스트림 플리핑은 0.8% 메타데이터 오버헤드로 핀리스 DBI를 구현하며, 보고서는 I/O 전력을 20% 절감할 수 있다고 밝힌다.
- 보고서는 다양한 언어 및 음성 모델에서 Raptor 3D-DRAM이 각각 HBM 기반 및 SRAM 기반 솔루션 대비 4.71배 및 2.44배의 처리량을 제공한다고 밝힌다.
보고서 해설
개요
보고서는 생성형 추론에서 용량, 대역폭, 전력 소비 간의 긴장에서 출발하여 d-Matrix Raptor가 로직 다이를 DRAM 위에 직접 적층하고 메모리 매핑, 데이터 전송, 열 리프레시, 오류 정정, 리던던시 메커니즘을 공동 설계함으로써 저지연 장문맥 추론에 3D-DRAM을 활용하는 방식을 설명한다.
핵심 견해
생성형 추론의 데이터 규모는 양방향에서 동시에 확대되고 있다. 모델 가중치는 계속 증가하는 한편, KV 캐시는 컨텍스트 길이와 동시 사용자 수에 따라 증가한다. 보고서는 사용자 64명, 사용자당 컨텍스트 길이 100만인 경우 KV 캐시가 약 935 GB라는 예를 제시한다. 추론의 프리필 단계는 일반적으로 컴퓨트 처리량의 제약을 받는 반면, 자기회귀 디코딩은 일반적으로 메모리 대역폭의 제약을 받는다. 저지연 소규모 배치 시나리오에서는 디코딩이 핵심 실행 시간을 차지한다. 높은 GQA와 추측 디코딩은 어텐션 연산을 컴퓨트 바운드로 만들 수 있지만, MoE는 중간 수준의 배치 크기와 추측 디코딩에서도 메모리 대역폭 바운드로 남을 수 있으므로 용량과 대역폭은 동시에 확장되어야 한다. 보고서는 기존의 두 메모리 유형이 각각 뚜렷한 단점을 지닌다고 주장한다. 온칩 SRAM은 서브나노초 지연시간을 제공한다. 예시 카드 한 쌍은 약 300 TB/s 대역폭, 4 GB 용량, 약 1 ns 지연시간 및 약 0.5 pJ/bit I/O 에너지 소비를 제공할 수 있다. 그러나 6T 저장 셀은 DRAM 1T1C 셀 면적의 약 10배이며, N5에서 N2 노드까지 비트 셀 면적은 약 0.021 µm² 수준으로 유지되고, 기가바이트급 용량의 누설 전력은 수십 와트에 이를 수 있으며, 실용적 용량은 약 4 GB이고 비용은 DRAM의 약 100배이다. HBM은 높은 용량을 제공하지만 패키지 가장자리 공간, 스택 수, 핀 속도 및 I/O 폭의 제약을 받는다. 보고서는 HBM4 시스템의 실용적 대역폭 상한을 약 20 TB/s로 추정한다. HBM을 2.4 pJ/bit에서 100 TB/s로 끌어올리면 인터커넥트 전력을 제외하고도 메모리 전력만 1.92 kW가 필요하다. Raptor의 핵심 접근법은 로직과 DRAM을 페이스투페이스로 적층하여 센티미터급 인터포저 경로와 PHY를 밀리미터급 수직 연결로 대체하는 것이다. 보고서는 3D 수직 I/O 에너지 소비를 약 0.3–0.4 pJ/bit로 제시하며, 이는 HBM보다 대략 한 자릿수 낮다. 구체적인 인터페이스 추정치는 0.37 pJ/bit이며, HBM4는 약 2–3 pJ/bit이다. Raptor는 TSMC N4/N4P 로직 상층, 3D-DRAM 하층 및 36 µm 피치의 페이스투페이스 적층을 사용한다. 각 칩렛은 4 GB 용량, 12.5 TB/s 대역폭 및 840개의 DRAM 마이크로뱅크를 제공한다. 8개 칩렛은 32 GB, 100 TB/s 카드를 구성하고, 4개 카드는 128 GB, 400 TB/s 시스템을 구성하며, 총 72카드인 18개 트레이는 2.3 TB 용량과 7.2 PB/s 대역폭에 이른다. 모델 로딩 추정은 4비트 가중치, 8비트 KV 캐시 및 72카드 확장 도메인을 가정한다. GLM 5.2는 총 7,440억 개 파라미터와 400억 개 활성 파라미터를 포함하며, 컨텍스트 길이 100만에서 사용자당 44.7 GB의 KV 캐시가 필요하다. Kimi K3는 총 2.8조 개 파라미터와 약 1,020억 개 활성 파라미터를 포함하며, 사용자당 11.7 GB의 KV 캐시가 필요하다. 보고서는 각각 32 GB인 Raptor 카드 72개가 컨텍스트 길이 100만에서 Kimi K3를 수용할 수 있으며, 분리형 배포와 다중 랙이 추가 확장을 가능하게 한다고 밝힌다. 결론에서는 약 3조 파라미터 모델을 컨텍스트 길이 100만으로 서비스하는 단일 Raptor 랙이 사용자당 약 1,000 TPS를 지속적으로 제공할 수 있다고도 명시한다. 높은 대역폭은 컴퓨트, 메모리, 인터커넥트가 공동 설계될 때만 실효 성능으로 전환될 수 있다. 샤딩 및 집합 통신을 통해 Raptor는 전형적인 GPU 시스템의 약 72개 디바이스와 비교해 계층형 네트워크 전반에서 약 8,000개의 가상 디바이스를 조율해야 한다. 따라서 Amdahl의 법칙에 따른 제약을 피하려면 낮은 지연시간이 필요하다. 보고서는 패키지 내 풀 메시 토폴로지를 채택하고, 물리적 대각선 연결과 관련된 거리 증가, D2D 전력 소비 및 패키지 레이어 수 증가를 피하면서 패키지 내 지연시간을 줄이기 위해 가상 대각선 링크를 사용한다. 카드 내 및 카드 간 프로토콜은 소스 카드의 승인 응답이 필요 없는 디바이스 주도 단방향 푸시 전송을 사용하며, 다수의 짧은 메시지 전송을 병렬로 지원한다. 첫 번째 구체적 통합 과제는 뱅크-채널 매핑이다. 각 컴퓨트 엔진 액세스에는 128 B의 데이터가 필요하지만, 각 뱅크 컬럼 액세스는 32 B만 반환할 수 있으므로 각 채널은 이론적으로 4개 뱅크가 필요하다. 칩렛에는 256개 채널이 있고 DRAM에는 840개 뱅크가 있다. 72개의 예비 뱅크를 제외하면 사용 가능한 뱅크는 768개, 즉 채널당 3개뿐이다. 두 번의 액세스를 직접 수행하면 단일 128 B 플릿에 대해 192 B를 읽게 되어 33% 오버페치가 발생하고 약 33 TB/s가 낭비된다. 단순한 컬럼 스태거링 방식은 192 B 시프트 버퍼를 필요로 하며 타이밍 클로저와 검증의 난도를 높인다. Raptor는 ‘스트림 블로킹’을 사용한다. 네 번째 32 B 부분 액세스를 세 개의 플릿 간에 공유하여 4×96 B 입력이 정확히 3×128 B 출력이 되도록 함으로써 오버페치를 0%로 줄이고, 각 컬럼 액세스를 완전히 활용하며, 약 33 TB/s의 대역폭을 회수한다. 두 번째 과제는 I/O 전력 소비다. 100 TB/s 및 0.37 pJ/bit에서 I/O 자체는 약 296 W를 소비한다. 전통적인 HBM 데이터 버스 반전은 다중 사이클 버스트, 전체 버스트에 대한 사전 지식 및 전용 DBI 핀에 의존한다. Raptor의 3D-DRAM 인터페이스는 버스트나 사이드밴드 핀 없이 단일 사이클 256비트 전송을 사용하므로 이 메커니즘을 직접 재사용할 수 없다. ‘스트림 플리핑’ 방식은 채널별로 인접 플릿을 비교한다. 쓰기 시 반전이 더 적은 비트 전환을 유발하면 현재 플릿을 반전하고, 읽기 시 ECC와 함께 저장된 1비트 태그를 사용하여 데이터를 복원한다. 보고서는 이 방식이 0.8%의 오버헤드만 발생시키고 PHY 변경이 필요 없으며 I/O 전력을 20% 줄일 수 있다고 밝힌다. 세 번째 과제는 접합 온도 105°C에서의 신뢰성이다. 표준 DRAM 보존 시간은 85°C에서 32 ms이지만 105°C에서는 4 ms로 떨어져 리프레시 빈도가 8배 증가한다. 고온은 소프트 오류도 증가시키며, 840개 뱅크에서 비롯되는 수율 위험, 단일 뱅크 실패로 인한 채널 비대칭, 그리고 ECC·스크러빙·리프레시 간 처리량 경합을 모두 동시에 해결해야 한다. Raptor는 행 수가 16–32배 적은 딥뱅크 구조를 활용하므로 4 ms 리프레시의 대역폭 비용은 1.37%에 불과하며 약 100 TB/s를 유지할 수 있다. 마지막 8개의 컬럼 위치에는 인터리브된 [132,128] 리드-솔로몬 오류 정정 코드와 DBI 비트가 저장된다. 온라인 리던던트 마이크로뱅크 72개는 2단계 뱅크 체인을 사용해 임의 위치에서 최대 두 개의 장애를 처리하며, 예비 뱅크가 보완함으로써 무시할 수 있는 수준의 배선 비용만 추가하고 대칭적 채널 폭을 유지한다. 실리콘 면적 및 실효 대역폭 기반 비교에서 Raptor의 용량 밀도는 11.4 MB/mm²로 HBM4 24 Gb의 21.9, HBM4 32 Gb의 26.3, Rubin R200의 21.9 MB/mm²보다 낮다. 그러나 대역폭 밀도는 32.6 GB/s/mm²로 각각 1.67, 1.51, 1.39 GB/s/mm²를 크게 웃돈다. Raptor의 GB/s당 전력 소비는 2.96 mW이며, 모든 비교 대상은 40.0 mW이다. 이 비교는 Raptor의 실효 대역폭 활용률 83%와 Rubin의 85%를 가정한다. 따라서 보고서는 저지연 추론에 카드당 최대 용량이 반드시 필요한 것은 아니며, 적정 용량과 극도로 높은 대역폭의 조합이 더 적합하다고 강조한다. 초기 실리콘 자료는 Llama-3.1 70B, DeepSeek-V3, Kimi K2, GPT-OS, Whisper, Canary 등을 포함한 모델에서 Raptor 3D-DRAM이 HBM 기반 솔루션 대비 4.71배, SRAM 기반 솔루션 대비 2.44배의 처리량을 제공하고 네트워크 지연시간 및 대역폭에도 덜 민감하다고 밝힌다.
분석 프레임워크
보고서는 먼저 생성형 추론의 병목을 프리필 및 디코딩 단계로 분해한 다음, 용량, 대역폭, 지연시간, I/O 에너지 소비 및 패키징 제약 측면에서 SRAM, HBM 및 3D-DRAM을 비교한다. 이어 칩렛 수준부터 카드, 트레이, 72카드 랙까지 모델 용량과 대역폭을 추정하고, 뱅크 매핑, I/O 전력 소비, 고온 리프레시, ECC 및 리던던시 문제를 하나씩 분석한다. 마지막으로 실효 대역폭 활용률, 실리콘 면적 단위당 지표, 대역폭 단위당 전력 소비 및 다중 모델 처리량 비교를 통해 설계 트레이드오프를 검증한다.
방법론 메모
추론 데이터 요구사항과 메모리 역량의 매칭
보고서는 증가하는 모델 가중치와 KV 캐시를 용량 및 대역폭 수요로 간주한 후, 이 수요를 SRAM, HBM 및 3D-DRAM이 제공할 수 있는 용량, 대역폭 및 전력 소비와 비교하여 어떤 메모리 아키텍처가 장문맥 추론에 더 적합한지 판단한다.
프리필–디코딩 병목 분해
보고서는 추론 프로세스를 일반적으로 컴퓨트 처리량에 의해 제한되는 프리필 단계와 일반적으로 메모리 대역폭에 의해 제한되는 디코딩 단계로 나누어, 고대역폭 3D-DRAM이 주로 해결하는 실행 시간의 부분을 설명한다.
하드웨어, 아키텍처 및 워크로드 공동 설계
보고서는 3D-DRAM을 외부 저장장치로 취급하는 대신, 물리적 적층이 제공하는 원시 대역폭을 실효 추론 처리량으로 전환할 수 있도록 뱅크 매핑, 데이터 흐름, 인터커넥트 프로토콜, 리프레시, 오류 정정 및 리던던시를 공동 설계한다.
실리콘 면적 및 실효 대역폭의 정규화 비교
보고서는 Raptor, HBM4 및 Rubin R200을 제곱밀리미터당 용량, 제곱밀리미터당 대역폭 및 GB/s당 전력 소비로 비교하며, 명목 사양만 비교하지 않기 위해 Raptor의 83% 및 Rubin의 85% 실효 대역폭 활용률을 반영한다.
Amdahl의 법칙
보고서는 메모리 대역폭이 크게 증가하더라도 카드 내 또는 카드 간 통신 지연시간이 그에 맞춰 감소하지 않으면 남아 있는 직렬 또는 통신 구성요소가 전체 시스템 가속을 제한할 것임을 설명하기 위해 이 법칙을 사용한다.
자산 매핑 및 비교
투자 논리에서 명시된 자산으로의 구조화 매핑(강점, 약점, 비교 대상, 위험).
- d-Matrix Raptor 3D-DRAM 생성형 추론 가속기보고서는 이를 장문맥 저지연 생성형 추론을 위한 3D 적층 통합 로직-메모리 플랫폼으로 제시한다.
- 강점
- 카드당 100 TB/s 대역폭, 낮은 I/O 에너지 소비, 칩렛에서 72카드 랙까지의 확장성, 그리고 스트림 블로킹, 스트림 플리핑, 열 인지 리프레시, ECC 및 뱅크 체인을 포함한 공동 설계 기능.
- 약점
- 카드당 용량은 32 GB이며, 실리콘 면적 기준 용량 밀도는 11.4 MB/mm²로 보고서가 제시한 HBM4 및 Rubin R200 수치보다 낮다. 또한 시스템은 약 8,000개의 가상 디바이스를 조율해야 한다.
- 비교
- 보고서는 Raptor의 대역폭 밀도를 32.6 GB/s/mm², 대역폭 단위당 전력 소비를 2.96 mW/GB/s로 제시하며, 비교 대상은 각각 1.39–1.67 GB/s/mm² 및 40.0 mW/GB/s이다. 모델 간 처리량은 각각 HBM 및 SRAM 기반 솔루션보다 4.71배 및 2.44배 높다.
- 위험
- 통합 위험에는 3D 적층의 열 관리 및 전력 공급, 마이크로범프 수율, 뱅크 장애, 105°C에서의 리프레시 및 소프트 오류, 폭넓은 병렬 버스의 신호 무결성, 다중 칩렛 및 다중 카드 통신 지연시간이 포함된다.
핵심 데이터
- 컨텍스트 길이 100만에서 사용자 64명의 KV 캐시약 935 GB장문맥과 동시 사용자가 메모리 용량 요구사항을 함께 증폭시키는 방식을 보여준다.
- SRAM 사양 예시300 TB/s, 4 GB, 약 1 ns, 약 0.5 pJ/bit뛰어난 대역폭과 지연시간을 제공하지만 용량, 누설 전력 및 비용이 확장을 제한한다.
- 실용적 HBM4 대역폭 상한약 20 TB/s패키지 가장자리 공간, 스택 수 및 I/O 확장의 제약을 받는다.
- 100 TB/s에서 HBM 메모리 전력1.92 kW2.4 pJ/bit 기준으로 계산되었으며 인터커넥트 전력은 제외한다.
- Raptor 단일 카드32 GB, 100 TB/s각각 4 GB 및 12.5 TB/s를 제공하는 8개의 3D-DRAM 칩렛으로 구성된다.
- Raptor 72카드 랙2.3 TB, 7.2 PB/s18개 트레이와 72개 카드로 구성된다.
- GLM 5.2 모델 추정치총 744B 파라미터, 활성 40B 파라미터, 사용자당 44.7 GB KV컨텍스트 길이 100만을 가정한다.
- Kimi K3 모델 추정치총 2.8T 파라미터, 약 102B 활성 파라미터, 사용자당 11.7 GB KV32 GB 카드 72개로 컨텍스트 길이 100만에서 모델을 수용할 수 있다.
- 기존 뱅크 매핑 오버페치33%, 약 33 TB/s채널당 뱅크가 3개뿐이므로 128 B 플릿을 직접 읽으면 192 B를 가져와야 한다.
- 스트림 블로킹 효과0% 오버페치부분 액세스를 공유한 후 384 B 입력은 384 B의 실효 출력에 대응한다.
- 100 TB/s에서 3D-DRAM I/O 전력296 W0.37 pJ/bit 기준으로 계산되었다.
- 스트림 플리핑 효과20% 전력 절감, 0.8% 오버헤드태그는 ECC와 함께 저장되므로 추가 PHY 사이드밴드 핀이 필요 없다.
- 105°C에서 리프레시 요구사항32 ms가 4 ms로 감소, 리프레시 빈도 8배 증가딥뱅크 설계는 대역폭 비용을 1.37%로 제한한다.
- 대역폭 밀도Raptor 32.6 GB/s/mm²; HBM4 및 Rubin R200은 1.67, 1.51, 1.39 GB/s/mm²실효 대역폭 기준으로 비교되었다.
- 대역폭 단위당 전력 소비Raptor 2.96 mW/GB/s; 비교 대상 40.0 mW/GB/s낮을수록 좋다.
- 모델 간 처리량 비교HBM 대비 4.71배, SRAM 대비 2.44배 높음보고서에 열거된 언어 모델 및 음성 모델 워크로드를 포괄한다.
영향과 시사점
보고서는 생성형 추론 가속기 경쟁이 단순히 컴퓨트 유닛을 추가하는 방식에서 벗어나 데이터 용량, 대역폭, 에너지 소비 및 통신 지연시간을 동시에 해결하는 방향으로 이동하고 있다고 주장한다. Raptor는 HBM보다 훨씬 높은 대역폭 밀도와 대역폭 단위당 낮은 전력 소비를 얻는 대신 단위 면적당 일부 용량 밀도를 희생한다. 뱅크 매핑, 전송 인코딩, 고온 리프레시, ECC 및 리던던시 설계가 초기 실리콘 결과가 시사하는 대로 작동한다면, 카드당 적정 용량과 극도로 높은 대역폭의 조합은 장문맥 저지연 디코딩을 개선하고 조 파라미터 모델을 72카드 랙으로 확장하는 것을 지원할 수 있다.
위험
- 가속기 열은 온도에 민감한 DRAM 스택을 통해 방출되어야 하며, 수백 와트의 전력은 TSV를 통해 공급되어야 하므로 접합 온도, 전압 강하 및 열 제약을 유발할 수 있다.
- 840개 뱅크와 36 µm 마이크로범프는 수율 및 정렬 위험을 높인다. 1%의 고장률만으로도 전체 채널이 비활성화되거나 채널 비대칭이 발생할 수 있다.
- 105°C에서 DRAM 보존 시간은 32 ms에서 4 ms로 감소하고 리프레시 빈도는 8배 증가한다. 소프트 오류, ECC, 스크러빙 및 리프레시의 조율이 미흡하면 처리량이 감소할 수 있다.
- 폭넓은 병렬 버스는 크로스토크, 동시 스위칭 노이즈, 클록 분배 및 스택 간 스큐 문제에 직면한다.
- 약 8,000개의 가상 디바이스에 걸친 샤딩 및 집합 통신은 네트워크 토폴로지, 프로토콜, 대역폭 및 저지연에 까다로운 요구사항을 부과한다.
- 다중 적층 레이어로의 확장은 여전히 배선, 전력 공급 및 열 관리 과제에 직면하며, 하이브리드 본딩 경로 역시 2 µm 미만 피치와 8층 적층을 향해 발전해야 한다.
주시할 점
- 더 많은 실제 생성형 추론 워크로드에서 초기 실리콘의 100 TB/s 실효 대역폭, 전력 소비 및 처리량 결과가 검증되는지 모니터링한다.
- 72카드 및 다중 랙 배포에서 샤딩, 집합 통신 및 네트워크 지연시간이 보고서에서 설명한 확장 효율을 유지할 수 있는지 모니터링한다.
- 105°C 환경에서 4 ms 리프레시, 인터리브 ECC, 스크러빙 및 72개 예비 뱅크의 장기 신뢰성을 모니터링한다.
- 2 µm 미만 피치 및 8층 적층을 향한 하이브리드 본딩 로드맵과 다층 스택을 위한 배선, 전력 공급 및 열 관리의 진전을 모니터링한다.