AI 컴퓨팅에서의 HBF: HBF는 더 저렴한 HBM 버전이 아니다: 저대역폭·용량 중심 워크로드는 기회가 될 수 있지만, 밀집형 및 대규모 배치 추론은 비용 함정이 될 수 있다
이 보고서는 GB당 가격이 아닌 토큰당 비용을 기준으로 HBF를 평가하며, 소규모 배치 MoE, 희소 장문 컨텍스트 KV 및 전문가 병렬 통신 감소에 적합하다고 본다. 72-GPU 랙 시뮬레이션은 HBF가 동일 비용에서 약 14배의 용량을 제공할 수 있지만 대역폭은 약 0.6배에 불과해 랙 처리량에서는 HBM이 우위임을 보여준다.
요약
이 보고서는 GB당 가격이 아닌 토큰당 비용을 기준으로 HBF를 평가하며, 소규모 배치 MoE, 희소 장문 컨텍스트 KV 및 전문가 병렬 통신 감소에 적합하다고 본다. 72-GPU 랙 시뮬레이션은 HBF가 동일 비용에서 약 14배의 용량을 제공할 수 있지만 대역폭은 약 0.6배에 불과해 랙 처리량에서는 HBM이 우위임을 보여준다.
- HBF는 더 저렴한 HBM이 아니라 저비용·저대역폭 용량 계층으로 포지셔닝된다.
- 판단 기준은 토큰당 비용이며, 낮은 GB당 가격이 반드시 낮은 추론 비용으로 이어지지는 않는다.
- 72-GPU 시뮬레이션에서 올-HBF 랙은 올-HBM 랙의 약 14배 용량을 가졌지만 총 대역폭은 약 0.6배였다.
- HBF는 저배치 시나리오에서 비용을 절감할 수 있으나, 시뮬레이션에서는 약 85%의 유휴 용량도 나타났다.
- Kimi K3 사례에서 MoE 전문가 가중치는 전체 바이트의 93%를 차지하며, 기록 1회·콜드 리드 HBF 풀에 적합하다.
- HBF 배포에는 전용 할당자, 배치 정책, 비동기 프리페치 및 내구성 텔레메트리가 필요하다.
보고서 해설
개요
이 Hot Chips 2026 튜토리얼은 시스템 아키텍처 관점에서 AI 추론에서 HBF의 적용 경계를 검토한다. 핵심 결론은 HBF의 가치는 높은 대역폭이 아니라 높은 용량에서 나온다는 것이다. HBF는 소규모 배치 MoE, 희소 장문 컨텍스트 KV 및 로컬 전문가 저장을 개선할 수 있지만, 밀집형 모델, 대규모 배치 또는 랙 처리량을 중시하는 배포에서는 HBM이 여전히 더 경제적인 선택이다.
핵심 견해
보고서는 먼저 β와 α로 설명되는 메모리 기술 지형에서 HBF를 위치시킨다. β는 GB당 비용을, α는 용량 단위당 이용 가능한 대역폭을 의미한다. HBF는 저-β, 저-α의 용량 지향적 위치에 있으며 동일 비용에서 HBM의 약 8—16배 용량을 제공할 수 있지만, 더 저렴한 HBM으로 보아서는 안 된다. 보고서는 메모리 비용을 결정하기 위해 “$mem = β·max(C, I·b/α)” 공식을 사용한다. 여기서 C는 수용해야 하는 데이터량이고 I·b는 대역폭 요구사항이다. 경제성을 실제로 결정하는 것은 저렴한 GB를 얼마나 많이 구매하는지가 아니라 용량 제약과 데이터 공급 대역폭 제약 중 더 큰 값이다. 따라서 낮은 $/GB가 자동으로 낮은 $/token을 의미하지는 않는다. 워크로드 특성은 HBF가 유효 범위에 들어가는지를 결정한다. MoE 모델은 방대한 전문가 가중치를 모두 저장할 수 있지만, 각 토큰은 소수의 전문가만 활성화한다. 따라서 소규모 배치 B와 낮은 접근 강도 I에서는 모델이 주로 대역폭이 아닌 용량에 의해 제약받으며, 낮은 대역폭으로도 충분할 수 있다. 밀집형 모델은 더 광범위한 가중치 읽기를 요구한다. 배치 크기, 접근 강도 또는 I·b가 증가하면 HBF의 부족한 대역폭 때문에 시스템은 데이터 공급 요구사항을 충족하기 위해 더 많은 용량을 프로비저닝해야 하며, 교차점을 넘으면 오히려 HBM이 더 저렴해진다. 이에 따라 보고서는 HBF의 장점을 “작은 B, 낮은 I”의 MoE 하위 영역으로 제한하고, Dense 및 높은 B 워크로드는 HBM에 맡긴다. 배포 비교에는 올-HBM, 올-HBF 및 하이브리드 “2×HBF+6×HBM” 구성이 포함된다. 세 구성은 모두 동일한 비용을 달성할 수 있지만 용량과 대역폭은 서로 다르다. 단문 컨텍스트·저배치 시뮬레이션에서 HBF는 비용 측면에서 우위일 수 있지만, 용량의 약 85%가 유휴 상태로 남는다. 반면 HBM은 용량 한계를 넘어선 성능에 대해 비용을 지불하게 할 수 있다. 장문 컨텍스트 사례에서도 더 많은 용량이 반드시 더 나은 것은 아니다. 추가 용량은 I·b가 낮게 유지될 때에만 경제적 가치가 있다. 하이브리드 구성은 HBM을 핫 전문가 캐시로 활용하려 하지만, 혼합 질의에서는 전문가 인기도가 평탄화되는 경향이 있어 캐싱은 낮은 배치 크기 또는 유사 질의를 묶어 처리할 때만 효과적이다. 보고서는 또한 FP4의 Kimi-K2 1T 모델을 사용해 72-GPU, 랙 수준, 디코드 중심 시뮬레이션을 수행한다. 주요 컨텍스트는 입력 토큰 100만 개와 출력 토큰 1,000개이며, 32k/8k 및 1k/8k 시나리오가 보조로 사용된다. 데이터 병렬 인스턴스당 배치 크기는 1—512이며, 텐서 병렬성은 용량 요구사항 충족에, 데이터 병렬성은 랙 채우기에 사용되고, 비용은 자본 및 운영 지출을 3년에 걸쳐 상각한 비율로 표현된다. 올-HBM 구성은 TP8·DP9, 올-HBF 구성은 TP1·DP72, 하이브리드 구성은 TP2·DP36이다. 올-HBM, 올-HBF 및 하이브리드 구성의 데이터 병렬 인스턴스당 용량은 각각 2.3 TB, 4.1 TB 및 2.5 TB이며, 총 랙 용량은 각각 20.7 TB, 294.9 TB 및 89.3 TB로, 각각 1배, 약 14배 및 4.3배에 해당한다. 용량 확장은 대역폭 비용을 수반한다. 올-HBM의 총 랙 대역폭은 1,584 TB/s이고, 올-HBF는 922 TB/s로 약 0.6배이며, 하이브리드 구성은 1,418→279 TB/s를 제공한다. 이에 대응하는 GPU당 대역폭은 각각 22.0 TB/s, 12.8 TB/s 및 19.7→3.9 TB/s이다. 유사한 랙 비용과 전력 소비 조건에서 보고서는 HBM이 항상 더 많은 토큰을 처리할 수 있다고 결론짓는다. HBF는 단일 머신 또는 단일 인스턴스 용량에 제약받는 배포에 더 적합한데, 그렇지 않으면 여러 GPU가 필요한 모델을 단일 GPU에 담을 수 있기 때문이다. 다시 말해 “랙 수준 토큰당 비용”과 “모델이 한 대의 머신에 들어가는지 여부”는 서로 다른 메모리 선택으로 이어진다. HBF의 하드웨어 특성도 사용 방식을 제약한다. 보고서에 제시된 세 등급은 각각 0.384, 1.536 및 3.072 TB/s의 최대 사용자 대역폭과 8, 16 및 32 GT/s의 인터커넥트 속도를 제공하며, 용량 구성에는 8층 256 GiB 및 16층 512 GiB가 포함된다. 인터페이스는 64 B—4 KiB 읽기, 4 KiB 쓰기 및 4 KiB 페이지를 지원하지만, 최대 대역폭을 달성하려면 64 KB에 정렬된 64 KB 읽기와 1 MB 쓰기가 필요하다. HBF는 DMA를 통해 읽기와 쓰기를 수행하며 GPU 캐시 계층의 일부가 아니다. HBM과 함께 사용할 경우 독립적인 메모리 관리가 필요하다. 85°C에서 전원 인가 상태의 데이터 보존 시간은 약 24시간이며, 수명 주기는 호스트가 관리해야 한다. 약 10년의 수명을 달성하거나 내구성의 100% 소진을 방지하려면 쓰기를 신중하게 제어해야 한다. 전반적으로 이는 읽기 최적화, 쓰기 제약, 호스트 관리형 매체이므로 데이터 배치는 주로 소프트웨어 문제다. 소프트웨어 생태계와 관련해 보고서는 vLLM을 프로덕션 배포의 현재 기본 초점으로 취급하며, SGLang, LMDeploy, Modular MAX와 같은 범용 추론 엔진 및 TensorRT-LLM, OpenVINO, AWS Neuron, Google JetStream과 같은 벤더 최적화 스택도 함께 열거한다. 기존 vLLM 경로는 주로 CPU 또는 LMCache를 대상으로 하며 HBF를 직접 지원하지 않는다. HBF를 사용하려면 새로운 할당자 또는 백엔드, 핫/콜드 데이터 배치 정책, 비동기 프리페치 및 내구성 텔레메트리가 필요하다. 그렇지 않으면 하드웨어의 용량 우위를 프로덕션 추론 성과로 전환할 수 없다. Kimi K3 사례는 비교적 명확한 데이터 배치 방식을 보여준다. 2.8T 모델의 총 가중치는 1.56 TB이며, 이 중 바이트의 93%, 약 1.45 TB는 기록 1회·콜드 리드 특성을 가진 MoE 전문가 가중치로, 보고서는 이를 HBF 전문가 풀에 적합하다고 본다. 나머지 7%, 약 110 GB의 가중치는 HBM에 더 적합하다. 100만 토큰 시퀀스당 KV Cache는 약 30 GB다. HBF는 더 큰 용량으로 고정 호스트 DRAM을 대체하는 KV 오프로딩 풀 및 프리픽스 캐시 역할도 할 수 있다. 이는 계층형 아키텍처를 만든다. HBF는 방대하지만 상대적으로 콜드한 전문가 가중치와 오프로드된 KV를 저장하고, HBM은 활성 가중치와 대역폭 민감 데이터을 저장한다. 희소 어텐션은 HBF의 적용성을 더욱 확장한다. 장문 컨텍스트 또는 멀티턴 KV의 경우 시스템은 전체 컨텍스트를 저비용으로 유지하면서 상위 k 부분만 읽을 수 있다. 보고서는 φ=top-k/context의 읽기 비율을 약 1%—2%로 제시하며, 이는 임계값 φ*=α/l보다 낮다. 이 조건에서 HBF 용량은 모든 KV를 보존할 수 있고, 더 적은 읽기량은 대역폭 한계에 도달하는 것을 피한다. 그러나 이 장점은 DSA, CSA, Kimi-Linear 같은 희소 어텐션 모델에 명시적으로 의존하며 전체 컨텍스트를 밀집하게 읽어야 하는 아키텍처에는 적용되지 않는다. HBF 용량은 전문가 병렬 통신도 줄일 수 있다. 기존 사례에서는 8개 GPU에 전문가를 샤딩하고 매 레이어마다 all-to-all을 수행한다. 두 노드가 각각 전문가를 HBF에 로컬로 저장할 수 있다면 전문가 병렬 샤딩을 줄여 all-to-all 통신을 크게 낮추거나 없앨 수 있다. 따라서 용량은 모델 적재 여부를 해결할 뿐 아니라 일부 통신 오버헤드를 되돌려 받을 수 있으나, 이 이점 역시 전문가 접근 지역성과 프리페치 대역폭에 따라 달라진다. 궁극적인 결론은 HBF가 범용 대체재가 아니라 정밀 도구라는 것이다. HBF는 낮은 대역폭 수요, 소규모 배치/낮은 접근 강도의 MoE 및 긴 컨텍스트를 갖춘 희소 KV 시나리오에서만 비용 우위를 제공하며, 이 범위를 벗어나면 함정이 될 수 있다. 가치를 확대하려면 읽기 대역폭 α가 증가해야 하고, HBM 대비 GB당 비용 격차 β가 충분히 커야 하며, 쓰기 내구성, 쓰기 대역폭, 지연시간 및 소프트웨어 지원 문제도 해결되어야 한다.
분석 프레임워크
보고서는 먼저 β, α, 용량 C 및 대역폭 요구사항 I·b를 사용한 메모리 비용 방정식을 수립한 뒤, MoE와 Dense, 배치 크기, 컨텍스트 길이 및 접근 희소성에 따라 워크로드를 세분화한다. 이후 올-HBM, 올-HBF 및 하이브리드 구성을 비교하고 Kimi-K2의 72-GPU 랙 시뮬레이션으로 용량, 대역폭 및 3년 상각 비용을 평가한다. 마지막으로 Kimi K3 데이터 레이아웃, vLLM 소프트웨어 경로, 희소 어텐션 및 전문가 병렬 통신을 결합하여 HBF의 배포 조건과 경계를 판단한다.
방법론 메모
β—α 메모리 비용 방정식
보고서는 β를 GB당 비용, α를 용량 단위당 대역폭으로 사용하고, $mem = β·max(C, I·b/α)를 통해 용량 및 데이터 공급 대역폭 요구사항 충족에 필요한 메모리 비용을 비교하여 낮은 GB당 가격이 반드시 토큰당 비용을 낮추지 않는 이유를 설명한다.
랙 수준 토큰당 비용 시뮬레이션
동일한 72-GPU 랙, 비용 및 전력 소비 가정하에서 보고서는 텐서 병렬 및 데이터 병렬 구성을 조정해 올-HBM, 올-HBF 및 하이브리드 메모리의 용량과 대역폭을 비교하고, 3년에 걸쳐 상각한 자본 및 운영 지출을 바탕으로 추론 경제성을 평가한다.
HBF 대체의 워크로드 기반 경계
보고서는 HBF를 HBM의 포괄적 대체재로 취급하는 대신, MoE와 Dense, 배치 크기, 컨텍스트 희소성 및 배포 규모에 따라 HBM 또는 호스트 DRAM을 대체할 수 있는 구체적인 데이터 풀을 결정한다.
자산 매핑 및 비교
투자 논리에서 명시된 자산으로의 구조화 매핑(강점, 약점, 비교 대상, 위험).
- HBFAI 추론에서 고용량·저대역폭 메모리 계층으로 작동하며 MoE 전문가 풀, 오프로드된 KV 및 프리픽스 캐시를 수용할 수 있다.
- 강점
- 동일 비용에서 용량은 HBM의 약 8—16배에 달할 수 있으며, 기록 1회·콜드 리드 데이터에 적합하고 전문가 샤딩 및 all-to-all 통신을 줄일 수 있다.
- 약점
- 대역폭이 낮고 쓰기가 제약되며 DMA와 독립적인 메모리 관리가 필요하고, 프로덕션 소프트웨어 지원도 아직 불완전하다.
- 비교
- 72-GPU 시뮬레이션에서 용량은 올-HBM의 약 14배이지만 총 대역폭은 약 0.6배이며, 랙 수준 토큰 처리량은 HBM보다 낮다.
- 위험
- 배치 크기나 접근 강도가 높아지거나 어텐션 읽기가 희소하지 않으면 대역폭 한계로 인해 저비용 용량 솔루션에서 비용 함정으로 바뀔 수 있다.
- HBM고대역폭 활성 가중치와 밀집형 또는 대규모 배치 추론에 사용되며, 보고서의 기준 메모리 솔루션 역할을 한다.
- 강점
- 더 높은 랙 수준 대역폭과 토큰 처리량을 제공하며 Dense, 높은 B 및 빈번히 접근되는 데이터에 적합하다.
- 약점
- GB당 비용이 더 높고, 용량이 제약되면 모델 수용을 위해 추가 텐서 병렬성 또는 GPU가 필요하다.
- 비교
- 올-HBM 랙은 용량 20.7 TB 및 총 대역폭 1,584 TB/s이고, 올-HBF 랙은 각각 294.9 TB 및 922 TB/s다.
- 위험
- 주로 단일 머신 용량에 제약받는 저대역폭 워크로드에서는 실제 요구사항을 초과하는 대역폭에 비용을 지불할 수 있다.
핵심 데이터
- HBF 상대 용량 포지셔닝동일 비용에서 HBM 용량의 약 8—16배HBF는 낮은 대역폭을 용량 우위와 교환하며, 더 저렴한 HBM 버전이 아니다.
- 세 HBF 등급의 최대 사용자 대역폭0.384 / 1.536 / 3.072 TB/sGrade 1, Grade 2 및 Grade 3에 해당한다.
- HBF 인터커넥트 속도8 / 16 / 32 GT/s세 하드웨어 등급에 해당한다.
- HBF 용량 구성8층 256 GiB; 16층 512 GiB고용량 포지셔닝을 반영한다.
- 72-GPU 랙 용량HBM 20.7 TB; HBF 294.9 TB; 하이브리드 89.3 TB각각 1×, 약 14× 및 4.3×에 해당한다.
- 데이터 병렬 인스턴스당 용량HBM 2.3 TB; HBF 4.1 TB; 하이브리드 2.5 TB시뮬레이션 구성은 각각 TP8·DP9, TP1·DP72 및 TP2·DP36이다.
- 총 랙 대역폭HBM 1,584 TB/s; HBF 922 TB/s; 하이브리드 1,418→279 TB/s올-HBF는 올-HBM의 약 0.6×다.
- GPU당 대역폭HBM 22.0 TB/s; HBF 12.8 TB/s; 하이브리드 19.7→3.9 TB/s고용량 구성의 대역폭 비용을 반영한다.
- 랙 시뮬레이션 모델Kimi-K2 1T @ FP4주요 컨텍스트는 입력 토큰 100만 개/출력 토큰 1,000개이며, DP당 배치 크기는 1—512다.
- 비용 기준3년 상각자본 및 운영 지출을 포함하며 비율로 제시된다.
- 저배치 HBF 용량 활용률약 85% 유휴 용량HBF는 낮은 B에서 비용 우위가 있지만, 대량의 용량이 사용되지 않는다.
- Kimi K3 총 가중치1.56 TB모델 크기는 2.8T다.
- MoE 전문가 가중치1.45 TB, 바이트의 93% 차지기록 1회·콜드 리드 특성을 가지며, 보고서는 이를 HBF에 적합하다고 본다.
- 나머지 가중치110 GB, 7% 차지보고서는 이들이 HBM에 더 적합하다고 본다.
- 장문 시퀀스당 KV Cache30 GB/100만 토큰 시퀀스HBF는 KV 오프로딩 풀과 프리픽스 캐시에 사용될 수 있다.
- 희소 어텐션 읽기 비율φ 약 1%—2%보고서는 이것이 임계값 φ*=α/l보다 낮아, top-k만 읽으면서 전체 KV를 HBF에 저장할 수 있다고 설명한다.
- 전원 인가 상태 데이터 보존85°C에서 약 24시간호스트가 데이터 수명 주기를 관리해야 한다.
- 목표 서비스 수명약 10년쓰기는 신중하게 관리되어야 하며, 그렇지 않으면 내구성의 100%가 소진될 수 있다.
영향과 시사점
보고서는 AI 메모리 구성은 GB당 가격만 비교하는 것이 아니라 워크로드와 배포 규모를 함께 고려해 결정해야 한다고 주장한다. HBF는 더 적은 GPU, 단일 머신 또는 로컬 노드에서 매우 큰 모델이나 KV 풀을 수용할 수 있으며, 전문가 병렬 통신을 줄일 수도 있다. 그러나 높은 랙 처리량을 추구하거나, 밀집형 모델을 사용하거나, 배치 크기를 키우면 낮은 대역폭이 토큰당 비용을 높인다. 실제 배포는 HBF가 방대한 콜드 데이터를 담당하고 HBM이 활성·대역폭 민감 데이터를 유지하는 계층형 접근 방식을 사용할 가능성이 더 높다.
위험
- 배치 크기, 접근 강도 또는 I·b가 증가하면 HBF는 대역폭 한계에 도달하고 HBM이 더 저비용 선택지가 될 수 있다.
- 혼합 질의에서는 전문가 인기도가 평탄화되는 경향이 있어 핫 전문가 캐싱이 실패할 수 있다.
- HBF의 쓰기 내구성, 쓰기 대역폭 및 지연시간은 엄격한 호스트 측 관리가 필요하며, 그렇지 않으면 서비스 수명과 가용성이 영향을 받을 수 있다.
- 기존 vLLM 경로는 주로 CPU 또는 LMCache를 대상으로 하며 HBF 할당자, 배치 정책, 비동기 프리페치 및 내구성 텔레메트리가 부족하다.
- 희소 KV 시나리오의 장점은 희소 어텐션 모델에 의존하며, 컨텍스트를 밀집하게 읽는 경우에는 적용되지 않는다.
주시할 점
- HBF 읽기 대역폭 α가 증가할 수 있는지와 HBM 대비 GB당 비용 격차 β가 유지될 수 있는지를 모니터링한다.
- 쓰기 내구성, 쓰기 대역폭 및 지연시간 문제가 해결될 수 있는지를 모니터링한다.
- vLLM과 같은 추론 엔진이 HBF 백엔드, 전용 할당자, 배치 정책, 비동기 프리페치 및 내구성 텔레메트리를 추가하는지 모니터링한다.
- 멀티에이전트 접근의 지역성, 프리페치 대역폭 한계 및 메모리 구성과 워크로드 간의 적합성을 모니터링한다.
- 희소 어텐션 모델과 유사 질의의 배치 처리가 실제 접근 비율을 HBF의 유효 범위 내로 유지할 수 있는지 모니터링한다.