보고서 해설
월가 주요 투자은행의 최신 리서치 커버
리서치 보고서 해설Hilo Research

Vertical-Die (V-die) 3.5D Integration for Ultrahigh-Bandwidth Memory Systems: V-die 3.5D 아키텍처는 측벽 인터커넥트와 직접 냉각을 통해 기존 HBM의 I/O, 용량 및 냉각 병목을 극복한다

이 보고서는 수직 다이 V-die 아키텍처를 제안하고 전자기, 시스템 및 열 스케일을 아우르는 모델을 사용해 그 실현 가능성을 검증한다. 결과는 16-Hi HBM4 대비 대역폭 4.01배 증가, LLM 디코딩 속도 81.2% 향상, 컨텍스트 확장 시 처리량 안정성 2.2배 향상 및 최고 온도 43.7% 감소를 보여준다.

날짜20260803
업종Semiconductor Memory and Advanced Packaging

요약

이 보고서는 수직 다이 V-die 아키텍처를 제안하고 전자기, 시스템 및 열 스케일을 아우르는 모델을 사용해 그 실현 가능성을 검증한다. 결과는 16-Hi HBM4 대비 대역폭 4.01배 증가, LLM 디코딩 속도 81.2% 향상, 컨텍스트 확장 시 처리량 안정성 2.2배 향상 및 최고 온도 43.7% 감소를 보여준다.

—
고대역폭 메모리V-die3.5D 통합첨단 패키징인공지능메모리 월직접 액체 냉각칩렛 시스템
  • V-die는 DRAM 다이를 수직으로 배치하고 측벽을 통해 하단 범프에 연결하여 실리콘 관통 전극 수에 대한 의존도를 낮춘다.
  • 구성 비교 결과, 핀 수는 2048개에서 8192개로 증가하고 이론상 메모리 대역폭은 10.24 TB/s에서 40.96 TB/s로 상승한다.
  • 9 mm RDL 배선은 HBM의 5 mm 배선보다 길지만, 8 Gbps에서 여전히 JEDEC HBM4 수신기 아이 마스크 표준을 충족한다.
  • LLM 시뮬레이션은 컨텍스트 길이 확장에 따라 디코딩 속도 81.2% 향상 및 처리량 안정성 2.2배 향상을 제공하는 것으로 요약된다.
  • TSV가 없는 V-die DRAM은 전력 소비를 25% 절감하고 다이 면적을 회수할 수 있다.
  • 냉각재는 다이 사이의 갭을 직접 통과해 흐르며, 16-Hi HBM4 대비 최고 온도를 43.7% 낮춘다.

보고서 해설

개요

이 연구는 AI 메모리 월 문제를 다루는 반도체 아키텍처 연구이다. 보고서는 채널당 데이터 전송률, 적층 높이 및 I/O 폭에 기반한 기존 HBM 확장 경로가 TSV 면적, 패키지 높이 및 열 축적으로 인해 점점 더 제약받고 있다고 주장한다. 제안된 V-die 3.5D 통합은 측벽 I/O, 하단 범프 및 직접적인 다이 간 냉각을 통해 더 큰 I/O 및 열 확장성을 제공한다.

핵심 견해

보고서는 먼저 AI 모델 크기의 성장과 GPU당 메모리 용량 확대 속도 간의 불일치를 문제의 원인으로 지목한다. 고급 Transformer 모델의 파라미터 수는 2년마다 410배 증가하는 반면 GPU당 메모리는 단 2배 증가하는 것으로 설명된다. 역사적으로 HBM은 주로 채널당 데이터 전송률, 적층 높이 및 I/O 폭의 세 가지 차원에서 확장되어 왔다. 보고서에 제시된 세대별 경로는 HBM1(2014), HBM2(2018), HBM2E(2020), HBM3(2022), HBM3E(2024), HBM4(2026)를 포함하며, 적층은 4-Hi에서 12-Hi/16-Hi로, 채널당 전송률은 1 Gbps에서 8 Gbps로, I/O 수는 1024개에서 2048개로 증가한다. 그러나 이러한 확장 방식은 점차 물리적 제약을 받고 있다. 첫 번째 제약은 TSV가 사용 가능한 DRAM 면적을 차지하므로 그 수를 무한정 늘릴 수 없다는 점이다. 두 번째는 Z축 방향의 패키지 높이이다. 표는 HBM1/HBM2, HBM3 및 HBM4의 일반적인 총높이가 각각 약 720, 720 및 775마이크로미터임을 보여주며, 8-Hi, 12-Hi 및 16-Hi 구성의 일반적인 층당 두께는 각각 약 90, 60 및 48.4마이크로미터이다. 고정된 높이 제약 아래에서 더 많은 층을 추가하려면 다이를 더 얇게 만들어야 하며, 이는 수율에 영향을 미치고 열 밀도를 높일 수 있다. 세 번째 제약은 수직 열 경로이다. 하단 다이에서 발생한 열은 여러 층의 BEOL, 마이크로범프, 언더필 및 잠재적 미세 공극을 통과해야 한다. 열저항은 층마다 누적되어 뚜렷한 온도 구배와 냉각 병목을 초래한다. V-die 설계는 DRAM 다이를 수직으로 배치하고 측벽 I/O 패드와 하단 범프를 통해 상호 연결을 구현한다. 이 구조는 더 이상 다이 내부 TSV에만 I/O 확장이 전적으로 제약되지 않게 하며, 다이 간 갭은 냉각재가 접근할 수 있는 표면적을 늘린다. 16-Hi 구성에서 보고서는 이 레이아웃이 더 강한 I/O 확장성을 제공한다고 주장하지만, 그 대가로 RDL이 모든 다이까지 연장되어야 한다. 최장 배선 경로는 기존 HBM의 약 5 mm와 비교해 약 9 mm이므로, 추가적인 삽입 손실, 반사 및 누화가 허용 가능한 수준을 유지하는지 검증해야 한다. 전기적 검증은 40 GHz, 50옴 정합 코플래너 도파관의 S-파라미터 측정을 이용해 전자기 시뮬레이션을 보정한다. 추출된 상대 유전율은 6.5, 손실 탄젠트는 0.002, 구리 전도도는 3×10^7 S/m이다. RDL은 상부 및 하부 접지면 사이 이산화규소에 매립된 구리 신호 트레이스로 모델링된다. 결과는 최대 전송률인 8 Gbps에서 V-die의 수동 채널 특성이 전반적으로 HBM과 유사함을 보여준다. 더 긴 트레이스는 삽입 손실을 증가시키지만 반사 손실은 유사하게 유지되며, 근단 및 원단 누화 모두 전체 주파수 범위에서 −30 dB 미만을 유지한다. 8 Gbps에서 V-die 채널은 0.3 UI 및 100 mV의 JEDEC HBM4 수신기 아이 마스크 요구사항을 충족하지만, 아이 마진은 HBM보다 약간 낮다. 시스템 수준 분석은 전자기적으로 검증된 파라미터를 JEDEC 타이밍 기반 메모리 모델에 통합하고 gem5를 사용해 합성 트래픽 시뮬레이션을 수행한다. 두 비교 구성은 모두 16개 메모리 스택과 8.0 Gbps 핀 전송률을 사용한다. 구성 표는 스택당 핀 수가 2048개에서 8192개로 증가하고, 메모리 대역폭은 10.24 TB/s에서 40.96 TB/s로 상승하며, 캐시 측에서 메모리 I/O 역량을 가리는 것을 방지하기 위해 L2 캐시 대역폭도 24.0 TB/s에서 96.0 TB/s로 증가함을 보여준다. 이 결과를 바탕으로 보고서는 궁극적으로 V-die가 4.01배 높은 대역폭을 제공할 수 있다고 결론짓는다. 애플리케이션 수준에서 LLMCompass는 A100 모델과 본 연구를 위해 새로 구축된 H100 모델을 평가하는 데 사용된다. 워크로드는 1,750억 개 파라미터, 96개 레이어, 96개 어텐션 헤드 및 12288의 은닉 차원을 갖는 모델이다. 보고서는 토큰 생성률과 연산 수준 지연시간을 사용해 추론 디코딩 성능을 측정하며, V-die가 디코딩 속도를 81.2% 향상한다고 결론짓는다. 컨텍스트 확장 테스트에서 결과 페이지는 24.8%의 속도 감소를 나타내는 반면, 보고서는 V-die가 기준 설계보다 2.2배 높은 처리량 안정성을 제공한다고 결론지으며, 더 높고 안정적인 메모리 대역폭이 장문 컨텍스트 추론의 메모리 병목을 완화할 수 있음을 보여준다. 전력 및 열 분석은 V-die의 확장 이점을 더욱 설명한다. HBM4 베이스 다이는 PHY에 6 W, TSV에 3 W로 구성된 9 W를 소비한다. 각 HBM4 DRAM 다이는 TSV 오버헤드를 포함해 약 2 W를 소비한다. V-die DRAM은 TSV를 제거하며, 보고서는 이를 통해 다이 면적을 확보하는 동시에 전력 소비를 25% 절감할 수 있다고 밝힌다. 기존 HBM4는 상부 콜드 플레이트에 의존하므로 열이 전체 스택을 통과해야 한다. 반면 V-die는 냉각재가 다이 간 갭을 직접 통과하도록 하여 각 다이에서 발생한 열을 국소적으로 흡수할 수 있게 한다. 다이 간 냉각재는 사실상 열 접지면 역할을 한다. 주변 온도 45°C의 동일 조건에서 V-die의 최고 온도는 HBM4보다 낮으며, 다이 간 뚜렷한 온도 구배를 제거한다. 최종 결과는 16-Hi HBM4 대비 최고 온도 43.7% 감소이다. 따라서 보고서는 V-die가 수직 배선과 직접 냉각을 통해 I/O, 용량 및 열 확장 제약을 동시에 완화하며, 전자기·시스템·애플리케이션·열 스케일 전반의 공동 모델링이 이 아키텍처가 향상된 LLM 성능으로 이어질 수 있는지를 판단하는 데 중요하다고 결론짓는다. 또한 칩렛과 이종 통합 시대의 시스템 시뮬레이션은 공칭 대역폭만으로 애플리케이션 성능을 추론하기보다 도메인 간 물리적 제약을 통합해야 한다고 강조한다.

분석 프레임워크

이 연구는 문제 정의, 아키텍처 설계, 물리적 검증, 시스템 시뮬레이션, 애플리케이션 테스트 및 열 검증의 순서로 진행된다. 먼저 세대별 HBM 사양을 사용해 TSV, 패키지 높이 및 열 경로가 부과하는 제약을 설명하고, 측벽 인터커넥트와 다이 간 냉각을 특징으로 하는 V-die 설계를 제안한다. 이어 측정으로 보정된 전자기 모델을 사용해 RDL 신호 무결성을 평가하고, 검증된 파라미터를 gem5 합성 트래픽 모델과 LLMCompass 워크로드 모델에 입력한 뒤, 전력 맵과 열저항 네트워크를 사용해 HBM4와 V-die의 열 성능을 비교한다.

방법론 메모

  • 기타기타

    교차 스케일 공동 검증 프레임워크

    이 보고서는 아키텍처 변경이 대역폭, 지연시간 및 디코딩 처리량의 실제 향상을 만들 수 있는지를 판단하기 위해 물리 계층의 전자기 및 열 제약을 시스템과 LLM 애플리케이션 모델로 단계적으로 전파한다.

  • 기타기타

    S-파라미터 측정으로 보정된 전자기 시뮬레이션

    이 연구는 40 GHz, 50옴 코플래너 도파관 측정을 이용해 유전율, 손실 및 구리 전도도를 추출한 후, 이 파라미터를 사용해 더 긴 RDL 트레이스의 삽입 손실, 반사, 누화 및 아이 다이어그램을 시뮬레이션한다.

  • 기타기타

    합성 트래픽 및 LLM 워크로드 시뮬레이션

    이 연구는 먼저 gem5와 JEDEC 타이밍 모델을 사용해 트래픽 부하에서 대역폭과 지연시간을 시험한 뒤, LLMCompass를 사용해 1,750억 개 파라미터 모델의 토큰 생성률과 연산 수준 지연시간을 평가한다.

  • 기타기타

    열저항 네트워크 분석

    이 보고서는 상부 콜드 플레이트와 직접 다이 간 냉각의 열전도 경로를 비교하고, 서로 다른 다이 층 전반의 총 열저항, 최고 온도 및 온도 구배를 분석한다.

핵심 데이터

  • 모델 파라미터 증가 대비 GPU 메모리 확장410-fold every two years; 2-fold for memory per GPUAI 시스템 메모리 월의 근간이 되는 성장 불일치를 설명하기 위해 보고서에서 사용
  • HBM 세대 범위HBM1 (2014) to HBM4 (2026)스택은 4-Hi에서 12-Hi/16-Hi로 확장되고 채널당 전송률은 1 Gbps에서 8 Gbps로 상승
  • 일반적인 층당 다이 두께90 micrometers, 60 micrometers, 48.4 micrometers각각 8-Hi, 12-Hi 및 16-Hi 구성에 해당하며, 고정된 패키지 높이 제약 아래 다이를 얇게 만들어야 하는 압력을 보여줌
  • RDL 경로 길이V-die 9 mm, HBM 5 mmV-die의 더 긴 배선은 삽입 손실을 증가시키지만 반사 손실은 유사하게 유지됨
  • 전자기 모델 보정40 GHz, 50 ohms코플래너 도파관 S-파라미터 측정값과 시뮬레이션의 상관관계를 통해 재료 파라미터를 추출
  • 추출된 재료 파라미터εr=6.5, tanδ=0.002, copper conductivity=3×10^7 S/m고충실도 RDL 배선 시뮬레이션에 사용
  • 누화 수준Both NEXT and FEXT below −30 dB분석된 전체 주파수 범위에서
  • 아이 다이어그램 규격 준수8 Gbps; 0.3 UI, 100 mVV-die는 JEDEC HBM4 수신기 아이 마스크를 충족하지만 마진은 HBM보다 약간 낮음
  • 스택당 핀 수Increased from 2048 to 8192HBM4와 V-die의 비교 구성
  • 메모리 대역폭Increased from 10.24 TB/s to 40.96 TB/s구성 값이며, 보고서는 실제 대역폭이 4.01배 향상된다고 결론
  • L2 캐시 대역폭Increased from 24.0 TB/s to 96.0 TB/s캐시 측이 메모리 I/O 역량을 가리는 것을 방지하기 위해 상향 조정
  • LLM 워크로드175 billion parameters, 96 layers, 96 attention heads, hidden dimension of 12288토큰 생성률과 연산 수준 지연시간을 시뮬레이션하는 데 사용
  • LLM 디코딩 성능81.2% fasterV-die의 상대적 성능에 대한 보고서의 요약
  • 컨텍스트 확장 안정성2.2 times처리량 안정성의 요약된 개선치이며, 결과 페이지는 24.8%의 속도 감소도 나타냄
  • HBM4 베이스 다이 전력 소비9 WPHY에 6 W, TSV에 3 W
  • 다이당 HBM4 DRAM 전력 소비Approximately 2 WTSV 오버헤드 포함
  • V-die DRAM 전력 절감25%TSV 제거로 인한 것으로, 다이 면적도 함께 회수
  • 최고 온도 개선Reduced by 43.7%동일한 주변 온도 45°C에서 16-Hi HBM4와 비교

영향과 시사점

보고서는 측벽 I/O와 직접 다이 간 냉각이 검증된 방식으로 구현될 수 있다면, V-die가 더 많은 TSV와 더 얇은 다이에 의존하는 기존 HBM 확장 경로를 우회하여 면적, 전력 소비 및 열 밀도의 상응하는 증가 없이 더 높은 용량과 넓은 I/O를 제공할 수 있다고 주장한다. AI 시스템에서 이러한 개선은 더 높은 LLM 디코딩 처리량과 장문 컨텍스트 워크로드의 더 높은 성능 안정성으로 이어질 수 있다. 이 연구는 또한 새로운 칩렛 아키텍처가 전자기, 열 및 애플리케이션 계층을 아우르는 공동 모델을 사용해 검증되어야 함을 보여준다.

위험

  • V-die는 각 층의 다이를 연결하기 위해 최대 약 9 mm 길이의 RDL 연결을 사용해야 한다. HBM의 약 5 mm 경로와 비교하면, 이는 더 높은 삽입 손실과 약간 줄어든 아이 다이어그램 마진을 초래한다.
  • 이 아키텍처에는 전기적, 타이밍, 용량 및 열 제약이 밀접하게 결합되어 있다. 보고서는 도메인 간 평가가 필요하며 단일 계층에서의 공칭 성능만으로는 시스템 실현 가능성을 입증하기에 불충분하다고 명시한다.

주시할 점

  • V-die 패키징 로드맵을 따라 인터커넥트, 제조 및 냉각 구조에서 이루어지는 추가적인 기술 진전.
  • 교차 스케일 검증 프레임워크가 칩렛 기반 이종 통합 시스템과 재사용 가능한 LLM 워크로드 모듈로 확장될 수 있는지 여부.

설정

최근 로그인을 보려면 로그인하세요