Vertical-Die (V-die) 3.5D Integration for Ultrahigh-Bandwidth Memory Systems: A arquitetura V-die 3.5D supera os gargalos de E/S, capacidade e resfriamento da HBM convencional por meio de interconexões nas paredes laterais e resfriamento direto
O relatório propõe uma arquitetura V-die vertical e valida sua viabilidade usando modelos que abrangem as escalas eletromagnética, de sistema e térmica. Os resultados mostram um aumento de 4,01 vezes na largura de banda, uma melhora de 81,2% na velocidade de decodificação de LLM, uma melhora de 2,2 vezes na estabilidade de throughput sob escalonamento de contexto e uma redução de 43,7% na temperatura de pico em comparação com a HBM4 16-Hi.
Resumo
O relatório propõe uma arquitetura V-die vertical e valida sua viabilidade usando modelos que abrangem as escalas eletromagnética, de sistema e térmica. Os resultados mostram um aumento de 4,01 vezes na largura de banda, uma melhora de 81,2% na velocidade de decodificação de LLM, uma melhora de 2,2 vezes na estabilidade de throughput sob escalonamento de contexto e uma redução de 43,7% na temperatura de pico em comparação com a HBM4 16-Hi.
- A V-die posiciona verticalmente os dies de DRAM e os conecta aos bumps inferiores pelas paredes laterais, reduzindo a dependência do número de vias através do silício.
- A comparação de configurações mostra que a contagem de pinos aumenta de 2048 para 8192, enquanto a largura de banda teórica da memória sobe de 10,24 TB/s para 40,96 TB/s.
- Embora o roteamento RDL de 9 mm seja mais longo que o roteamento de 5 mm da HBM, ele ainda atende ao padrão de máscara de olho do receptor JEDEC HBM4 a 8 Gbps.
- A simulação de LLM é resumida como proporcionando uma melhora de 81,2% na velocidade de decodificação e uma melhora de 2,2 vezes na estabilidade de throughput à medida que o comprimento de contexto aumenta.
- A DRAM V-die sem TSV pode economizar 25% no consumo de energia e recuperar área de die.
- O fluido refrigerante flui diretamente pelas lacunas entre os dies, reduzindo a temperatura de pico em 43,7% em comparação com a HBM4 16-Hi.
Interpretação do relatório
Visão geral
Este é um estudo de arquitetura de semicondutores que aborda o problema da parede de memória em IA. O relatório argumenta que o caminho convencional de escalonamento de HBM, baseado em taxa de dados por canal, altura da pilha e largura de E/S, é cada vez mais limitado pela área de TSV, altura do encapsulamento e acúmulo de calor. A integração V-die 3.5D proposta proporciona maior escalabilidade de E/S e térmica por meio de E/S nas paredes laterais, bumps inferiores e resfriamento direto entre dies.
Visões principais
O relatório atribui inicialmente o problema à incompatibilidade entre o crescimento do tamanho dos modelos de IA e a taxa de expansão da capacidade de memória por GPU: a contagem de parâmetros de modelos Transformer avançados é descrita como aumentando 410 vezes a cada dois anos, enquanto a memória por GPU aumenta apenas duas vezes. Historicamente, a HBM escalou principalmente em três dimensões: taxa de dados por canal, altura da pilha e largura de E/S. O caminho geracional apresentado no relatório abrange HBM1 (2014), HBM2 (2018), HBM2E (2020), HBM3 (2022), HBM3E (2024) e HBM4 (2026), com as pilhas progredindo de 4-Hi para 12-Hi/16-Hi, as taxas por canal aumentando de 1 Gbps para 8 Gbps e as contagens de E/S crescendo de 1024 para 2048. Contudo, essa abordagem de escalonamento está cada vez mais sujeita a restrições físicas. A primeira restrição é que os TSVs ocupam área utilizável de DRAM, impedindo que seu número aumente indefinidamente. A segunda é a altura do encapsulamento ao longo do eixo Z: a tabela indica alturas totais típicas de aproximadamente 720, 720 e 775 micrômetros para HBM1/HBM2, HBM3 e HBM4, respectivamente, enquanto as espessuras típicas por camada para configurações 8-Hi, 12-Hi e 16-Hi são aproximadamente 90, 60 e 48,4 micrômetros. Adicionar mais camadas sob uma restrição fixa de altura exige dies mais finos, o que pode afetar o rendimento e aumentar a densidade térmica. A terceira restrição é o caminho térmico vertical: o calor dos dies inferiores deve passar por múltiplas camadas de BEOL, microbumps, underfill e possíveis microvazios. A resistência térmica se acumula camada a camada, criando um gradiente de temperatura pronunciado e um gargalo de resfriamento. O projeto V-die organiza os dies de DRAM verticalmente e implementa interconexões por meio de pads de E/S nas paredes laterais e bumps inferiores. Essa estrutura deixa de manter o escalonamento de E/S inteiramente limitado pelos TSVs dentro do die, enquanto as lacunas entre dies aumentam a área de superfície acessível ao fluido refrigerante. Em uma configuração 16-Hi, o relatório argumenta que esse layout oferece maior escalabilidade de E/S, mas a contrapartida é que o RDL precisa se estender até cada die. O caminho de roteamento mais longo é de aproximadamente 9 mm, em comparação com aproximadamente 5 mm para a HBM convencional, tornando necessário verificar se a perda adicional de inserção, as reflexões e a diafonia permanecem aceitáveis. A validação elétrica calibra simulações eletromagnéticas usando medições de parâmetros S de uma guia de onda coplanar casada de 40 GHz e 50 ohms. A permissividade relativa extraída é 6,5, a tangente de perda é 0,002 e a condutividade do cobre é 3×10^7 S/m. O RDL é modelado como trilhas de sinal de cobre embutidas em dióxido de silício entre planos de terra superior e inferior. Os resultados mostram que, na taxa máxima de 8 Gbps, as características do canal passivo da V-die são em geral comparáveis às da HBM. As trilhas mais longas aumentam a perda de inserção, mas a perda de retorno permanece semelhante, enquanto a diafonia de extremidade próxima e a de extremidade distante permanecem ambas abaixo de −30 dB em toda a faixa de frequência. A 8 Gbps, o canal V-die atende aos requisitos de máscara de olho do receptor JEDEC HBM4 de 0,3 UI e 100 mV, embora sua margem de olho seja ligeiramente menor que a da HBM. A análise em nível de sistema incorpora os parâmetros validados eletromagneticamente a um modelo de memória baseado em temporização JEDEC e usa gem5 para simulação de tráfego sintético. Ambas as configurações de comparação usam 16 pilhas de memória e uma taxa de pinos de 8,0 Gbps. A tabela de configuração mostra que o número de pinos por pilha aumenta de 2048 para 8192, a largura de banda de memória sobe de 10,24 TB/s para 40,96 TB/s e a largura de banda do cache L2 aumenta correspondentemente de 24,0 TB/s para 96,0 TB/s, para evitar que o lado do cache mascare a capacidade de E/S da memória. Com base nesses resultados, o relatório conclui que a V-die pode fornecer largura de banda 4,01 vezes maior. No nível de aplicação, o LLMCompass é usado para avaliar o modelo A100 e um modelo H100 recém-construído para este estudo. A carga de trabalho é um modelo de 175 bilhões de parâmetros com 96 camadas, 96 cabeças de atenção e dimensão oculta de 12288. O relatório mede o desempenho de decodificação de inferência usando a taxa de geração de tokens e a latência em nível de operação, concluindo que a V-die proporciona uma melhora de 81,2% na velocidade de decodificação. No teste de escalonamento de contexto, a página de resultados indica uma redução de velocidade de 24,8%, enquanto o relatório conclui que a V-die proporciona estabilidade de throughput 2,2 vezes maior que o projeto de referência, demonstrando que uma largura de banda de memória maior e mais estável pode aliviar os gargalos de memória na inferência de contexto longo. A análise de potência e térmica explica ainda as vantagens de escalonamento da V-die. O die base HBM4 consome 9 W, compreendendo 6 W para o PHY e 3 W para TSVs. Cada die de DRAM HBM4 consome aproximadamente 2 W, incluindo a sobrecarga de TSV. A DRAM V-die elimina TSVs, o que, segundo o relatório, pode economizar 25% no consumo de energia ao mesmo tempo em que libera área de die. A HBM4 convencional depende de uma placa fria superior, exigindo que o calor percorra toda a pilha. A V-die, em vez disso, permite que o fluido refrigerante flua diretamente pelas lacunas entre dies, permitindo que o calor gerado por cada die seja absorvido localmente; o fluido refrigerante entre dies atua efetivamente como um plano de terra térmico. Sob condições idênticas, com temperatura ambiente de 45°C, a temperatura de pico da V-die é menor que a da HBM4, eliminando o pronunciado gradiente de temperatura entre dies. O resultado final é uma redução de 43,7% na temperatura de pico em comparação com a HBM4 16-Hi. O relatório, portanto, conclui que a V-die mitiga simultaneamente as restrições de escalonamento de E/S, capacidade e térmica por meio de roteamento vertical e resfriamento direto, e que a modelagem conjunta nas escalas eletromagnética, de sistema, de aplicação e térmica é fundamental para determinar se a arquitetura pode se traduzir em melhor desempenho de LLM. O estudo também enfatiza que a simulação de sistemas na era dos chiplets e da integração heterogênea deve incorporar restrições físicas entre domínios, em vez de inferir o desempenho de aplicações somente a partir da largura de banda nominal.
Estrutura de análise
O estudo segue a sequência de definição do problema, projeto de arquitetura, validação física, simulação de sistema, testes de aplicação e validação térmica. Primeiro, usa especificações geracionais de HBM para explicar as restrições impostas por TSVs, altura do encapsulamento e caminhos térmicos; em seguida, propõe um projeto V-die com interconexões nas paredes laterais e resfriamento entre dies. Posteriormente, avalia a integridade de sinal do RDL usando um modelo eletromagnético calibrado por medições, alimenta os parâmetros validados em um modelo gem5 de tráfego sintético e em um modelo de carga de trabalho LLMCompass e, por fim, compara o desempenho térmico de HBM4 e V-die usando mapas de potência e redes de resistência térmica.
Notas metodológicas
Estrutura de Validação Conjunta Multiescala
O relatório propaga progressivamente restrições eletromagnéticas e térmicas da camada física para modelos de sistema e de aplicação LLM, a fim de determinar se mudanças arquiteturais podem produzir melhorias reais em largura de banda, latência e throughput de decodificação.
Simulação Eletromagnética Calibrada por Medições de Parâmetros S
O estudo usa medições de guia de onda coplanar de 40 GHz e 50 ohms para extrair permissividade, perda e condutividade do cobre, usando então esses parâmetros para simular a perda de inserção, reflexões, diafonia e diagramas de olho das trilhas RDL mais longas.
Simulação de Tráfego Sintético e Carga de Trabalho de LLM
O estudo primeiro usa gem5 e um modelo de temporização JEDEC para testar largura de banda e latência sob cargas de tráfego, usando depois LLMCompass para avaliar a taxa de geração de tokens e a latência em nível de operação de um modelo de 175 bilhões de parâmetros.
Análise de Rede de Resistência Térmica
O relatório compara os caminhos de condução de calor de uma placa fria superior e do resfriamento direto entre dies, analisando a resistência térmica total, a temperatura de pico e os gradientes de temperatura em diferentes camadas de dies.
Dados principais
- Crescimento de Parâmetros do Modelo vs. Escalonamento da Memória da GPU410-fold every two years; 2-fold for memory per GPUUsado pelo relatório para ilustrar a incompatibilidade de crescimento subjacente à parede de memória de sistemas de IA
- Período Geracional da HBMHBM1 (2014) to HBM4 (2026)As pilhas escalam de 4-Hi para 12-Hi/16-Hi, enquanto as taxas por canal sobem de 1 Gbps para 8 Gbps
- Espessura Típica de Die por Camada90 micrometers, 60 micrometers, 48.4 micrometersCorrespondentes às configurações 8-Hi, 12-Hi e 16-Hi, respectivamente, ilustrando a pressão para afinar dies sob uma restrição fixa de altura de encapsulamento
- Comprimento do Caminho RDLV-die 9 mm, HBM 5 mmO roteamento mais longo da V-die aumenta a perda de inserção, mas a perda de retorno permanece semelhante
- Calibração do Modelo Eletromagnético40 GHz, 50 ohmsOs parâmetros dos materiais são extraídos correlacionando medições de parâmetros S de guia de onda coplanar com simulações
- Parâmetros de Material Extraídosεr=6.5, tanδ=0.002, copper conductivity=3×10^7 S/mUsados para simulação de alta fidelidade do roteamento RDL
- Nível de DiafoniaBoth NEXT and FEXT below −30 dBEm toda a faixa de frequência analisada
- Conformidade do Diagrama de Olho8 Gbps; 0.3 UI, 100 mVA V-die atende à máscara de olho do receptor JEDEC HBM4, mas sua margem é ligeiramente menor que a da HBM
- Pinos por PilhaIncreased from 2048 to 8192Configuração de comparação para HBM4 e V-die
- Largura de Banda de MemóriaIncreased from 10.24 TB/s to 40.96 TB/sValores de configuração; o relatório conclui que a largura de banda real melhora 4.01 vezes
- Largura de Banda do Cache L2Increased from 24.0 TB/s to 96.0 TB/sElevada para evitar que o lado do cache mascare a capacidade de E/S da memória
- Carga de Trabalho de LLM175 billion parameters, 96 layers, 96 attention heads, hidden dimension of 12288Usada para simular a taxa de geração de tokens e a latência em nível de operação
- Desempenho de Decodificação de LLM81.2% fasterO resumo do relatório sobre o desempenho relativo da V-die
- Estabilidade de Escalonamento de Contexto2.2 timesA melhora resumida pelo relatório na estabilidade de throughput; a página de resultados também indica uma redução de velocidade de 24.8%
- Consumo de Energia do Die Base HBM49 W6 W para o PHY e 3 W para TSVs
- Consumo de Energia de DRAM HBM4 por DieApproximately 2 WInclui a sobrecarga de TSV
- Economia de Energia da DRAM V-die25%Resultante da eliminação de TSVs, ao mesmo tempo em que recupera área de die
- Melhora da Temperatura de PicoReduced by 43.7%Em comparação com a HBM4 16-Hi sob a mesma temperatura ambiente de 45°C
Impacto e implicações
O relatório argumenta que, caso a E/S nas paredes laterais e o resfriamento direto entre dies possam ser implementados conforme validados, a V-die poderia contornar o caminho convencional de escalonamento de HBM, que depende de mais TSVs e dies mais finos, permitindo maior capacidade e E/S mais ampla sem aumentos equivalentes de área, consumo de energia e densidade térmica. Para sistemas de IA, essas melhorias poderiam se traduzir em maior throughput de decodificação de LLM e maior estabilidade de desempenho para cargas de trabalho de contexto longo. O estudo também demonstra que novas arquiteturas de chiplets devem ser validadas por meio de modelos conjuntos que abranjam camadas eletromagnéticas, térmicas e de aplicação.
Riscos
- A V-die deve usar conexões RDL de até aproximadamente 9 mm de comprimento para conectar dies em cada camada. Em comparação com os caminhos de aproximadamente 5 mm da HBM, isso resulta em maior perda de inserção e margem de diagrama de olho ligeiramente reduzida.
- A arquitetura envolve restrições elétricas, de temporização, capacidade e térmicas estreitamente acopladas. O relatório afirma explicitamente que a avaliação entre domínios é necessária e que o desempenho nominal em uma única camada é insuficiente para demonstrar a viabilidade do sistema.
Pontos a observar
- Avanços tecnológicos adicionais em interconexões, fabricação e estruturas de resfriamento ao longo do roteiro de encapsulamento V-die.
- Se a estrutura de validação multiescala pode ser estendida a sistemas de integração heterogênea baseados em chiplets e a módulos reutilizáveis de cargas de trabalho de LLM.