Interpretação de relatórios
Cobertura das pesquisas mais recentes dos principais bancos de investimento de Wall Street
Interpretação do relatórioHilo Research

Memória Semicondutora e Arquitetura de Computação de IA: O Die Base HBM Evoluirá de uma Camada de Interface para uma Plataforma de Sistema de IA para Controle, Expansão e Computação Próxima à Memória

O relatório propõe um roteiro de evolução em três estágios: primeiro, usar processos lógicos avançados e interfaces D2D compactas para liberar área de xPU; em seguida, adicionar RAS, expansão de memória externa e unidades de processamento ao die base; e, por fim, alcançar a integração 3D vertical da xPU e da pilha de DRAM por meio de zHBM.

InstituiçãoSamsung Memory Business
EmpresaArquitetura do Die Base HBM
SetorMemória Semicondutora e Arquitetura de Computação de IA

Resumo

O relatório propõe um roteiro de evolução em três estágios: primeiro, usar processos lógicos avançados e interfaces D2D compactas para liberar área de xPU; em seguida, adicionar RAS, expansão de memória externa e unidades de processamento ao die base; e, por fim, alcançar a integração 3D vertical da xPU e da pilha de DRAM por meio de zHBM.

Não foram fornecidos rating de título, preço-alvo ou preço atual
HBMDie BaseHBM PersonalizadaProcesso Lógico AvançadoAcelerador de IAInterface D2DComputação Próxima à MemóriaIntegração 3D
  • A contagem e o passo de TSVs, juntamente com a contagem e a velocidade de I/O do PHY do die base, tornaram-se os principais gargalos para a expansão adicional da largura de banda.
  • A partir do HBM4, a adoção de processos lógicos avançados para o die base é considerada necessária para conter o crescimento do consumo de energia e reduzir a área efetiva.
  • Um PHY D2D compacto pode encurtar canais, reduzir a energia por bit e devolver área à xPU ou disponibilizá-la para novas funções do die base.
  • Quando o HPB cobre mais de 50% da região de PHY, ele pode reduzir a temperatura de pico em mais de 35%.
  • O segundo estágio integra sensores, autoteste, controle de memória externa e unidades de processamento ao die base.
  • O zHBM de terceiro estágio elimina PHYs HBM convencionais, interfaces D2D e interposers 2.5D por meio de I/O distribuído e integração vertical.

Interpretação do relatório

Visão geral

O relatório discute como o papel do die base HBM está mudando em meio à demanda por computação impulsionada por IA. Sua visão central é que as restrições de largura de banda, energia, área e capacidade impulsionarão uma transição do HBM padrão para o HBM personalizado com uso de processos lógicos avançados, seguindo uma evolução em três estágios de “recuperação de área de xPU—expansão funcional—in­tegração 3D”.

Visões principais

O relatório primeiro distingue entre o die central e o die base em uma pilha HBM: o die central contém células DRAM, lógica central e TSVs, enquanto o die base fornece o caminho PHY-para-TSV para comunicação com o die de computação, além de funções de teste do die central, como DA, MBIST e IEEE 1500. Como uma largura de banda maior se torna o principal motor das sucessivas gerações de HBM, a arquitetura convencional enfrenta dois gargalos diretos: primeiro, limitações na contagem e no passo de TSVs no die base e na pilha de dies centrais; e segundo, limitações na contagem e velocidade de I/O do PHY do die base. Portanto, o relatório argumenta que a rápida expansão da largura de banda exige mudanças fundamentais no die base. A evolução de processo fornece a base para essa transformação. O roteiro apresentado no relatório mostra o die base passando de 2*nm para 1*nm entre HBM2 e HBM3E, enquanto HBM4 e HBM4E migram para um processo lógico de 4nm. No mesmo período, o SoC xPU evolui de 16n/12nm em 2016 para 3nm no HBM4 e abaixo de 3nm no HBM4E. A Samsung usa DRAM D1c e um processo lógico de 4nm no HBM4. O relatório enfatiza que, embora a eficiência energética por unidade continue melhorando, o consumo total de energia de MPGA continua aumentando. Portanto, a partir do HBM4, usar processos lógicos avançados para o die base é fundamental para conter o crescimento do consumo de energia. Isso também reduz a área efetiva e diminui a lacuna de processo entre o die base e o SoC xPU. Isso é definido como o início da verdadeira integração entre DRAM e lógica avançada. Com base nisso, o relatório distingue HBM padrão de HBM personalizado. O die base no HBM padrão fornece principalmente caminhos básicos de dados e teste, com grande parte de sua área usada passivamente para roteamento. O HBM personalizado, por outro lado, compartilha uma pilha padrão de dies centrais enquanto usa processos lógicos avançados para personalizar o die base e conceder-lhe funcionalidade semelhante à de um SoC. A motivação é que os métodos convencionais de escalonamento de xPUs estão se aproximando de limites físicos: o escalonamento de processo está desacelerando, dies monolíticos estão se aproximando do limite de tamanho de retículo, e as dimensões de interposers em soluções multichiplet também se aproximam de seus limites. Como o die base já usa um processo lógico avançado e possui área disponível substancial, o relatório propõe migrar algumas funções de xPU para o die base. O primeiro estágio concentra-se em recuperar área de xPU e otimizar a interface. O PHY HBM convencional ocupa a maior região funcional no die base e, de HBM2 a HBM4 padrão, sua área ocupada e o comprimento de canal continuaram aumentando para suportar maior largura de banda. O HBM personalizado substitui o PHY HBM convencional por uma interface D2D implementada usando um processo lógico avançado. Uma área de interface menor e canais mais curtos podem reduzir pJ/b, melhorar a eficiência energética e liberar área valiosa de silício para expansão de xPU. O relatório identifica HBM4 até HBM5 como um período de inflexão no qual processos lógicos avançados reduzem significativamente a área de PHY e D2D. No entanto, essa redução de área também aumenta a densidade de potência e cria pontos quentes térmicos. A comparação no relatório mostra que o sHBM4E possui velocidade de I/O de 14Gbps e densidade de potência de 0.5W/mm², enquanto o sHBM5 possui velocidade de I/O superior a 28Gbps, aproximadamente 2 vezes a do sHBM4E, e densidade de potência superior a 2.0W/mm². Para resolver essa questão, o relatório propõe um bloco de caminho térmico HPB baseado na experiência da Samsung com cHBM4. Quando o HPB cobre mais de 50% da região de PHY, a temperatura de pico pode ser reduzida em mais de 35%. O primeiro estágio também inclui migrar o controlador de memória do SoC xPU para o die base de HBM personalizado. O relatório considera o controlador de memória o principal candidato à migração porque essa disposição pode recuperar área de xPU enquanto mantém administrável o impacto térmico do controlador adicionado. Controladores de memória HBM convencionais estão sendo atualmente portados para cHBM. Quando o controlador é posicionado mais próximo da memória, o espaço não utilizado no die base também pode ser usado para recursos de reparo SRAM que fornecem decodificação e redirecionamento granular de endereços para células defeituosas e compartilham capacidade de reparo entre canais. Em comparação com os recursos limitados e inflexíveis de reparo de linhas e colunas no die central, a solução SRAM do die base oferece maior capacidade e maior flexibilidade de configuração. O segundo estágio usa a área do die base que permanece disponível após a migração do controlador de memória para adicionar funções. A primeira categoria é RAS e teste: cHBM pode integrar nativamente sensores de temperatura, tensão, processo e envelhecimento para fornecer telemetria em tempo real e de alta velocidade. Mecanismos de autoteste no chip, como OD-ATE e PGEN, podem expandir a cobertura de testes e melhorar o rendimento de fabricação. A segunda categoria é expansão de capacidade. O relatório observa que as janelas de contexto de modelos de IA estão crescendo 30 vezes por ano, aumentando significativamente as necessidades de cache KV, enquanto o armazenamento e a recuperação de memória de longo prazo continuam sendo grandes gargalos para modelos de IA de próxima geração. Portanto, SoCs de IA necessitam urgentemente de maior capacidade de memória além de largura de banda. O die base pode usar sua borda externa para conectar-se diretamente à memória externa e integrar PHYs e controladores dedicados. O relatório argumenta que essa abordagem pode oferecer largura de banda significativamente maior e menor latência do que a expansão PCIe convencional. O segundo estágio também pode migrar parte da computação de xPU para unidades de processamento no die base. Como os dados são processados mais perto da memória, os requisitos de largura de banda D2D, a movimentação de dados, o consumo de energia e a carga térmica podem ser reduzidos. Em soluções HBM avançadas dentro de sistemas 2.5D, as unidades de processamento do die base também podem reduzir significativamente a movimentação de dados pelo interposer, melhorando assim a eficiência energética em nível de sistema. Contudo, essa abordagem é restringida pela área limitada de silício do die base e pelo aumento da densidade térmica local causado pelas unidades de processamento. Portanto, a escala funcional deve equilibrar benefícios computacionais, área e dissipação de calor. O terceiro estágio é a verdadeira integração 3D representada pelo zHBM. O relatório argumenta que as arquiteturas de memória para IA estão se movendo rapidamente para um acoplamento estreito, sendo o objetivo-chave em cenários de AGI e inferência aumentar a largura de banda e TPS sob rigorosas restrições de energia. O zHBM integra verticalmente a xPU à pilha de dies centrais e elimina o interposer 2.5D. O I/O distribuído encurta os caminhos de dados dentro da pilha, ao mesmo tempo que remove interfaces bidimensionais, como PHYs HBM convencionais ou interfaces D2D. O principal benefício é uma redução substancial no consumo de energia de I/O: remover o alinhamento de dados e o I/O DQ de SERDES pode eliminar sobrecarga de energia desnecessária e converter a margem de energia e térmica economizada em maior desempenho computacional do sistema. O relatório usa “1 GPU mais 4 HBM4E” e “1 GPU mais 4 zHBM” como base para uma comparação de arquitetura de sistema, mas não fornece resultados quantitativos específicos. A implementação de zHBM ainda depende de recursos críticos de processo e codesign. A ligação wafer a wafer e a ligação híbrida de cobre devem fornecer densidade de I/O ultralta. O processo mostrado no relatório inclui ligação em nível de wafer de 4 camadas de dies centrais com uma xPU ou camada intermediária. Enquanto isso, o SoC e a DRAM devem ser coarquitetados usando um fluxo unificado de design e verificação. Em geral, o relatório considera o die base de lógica avançada como o elemento central da evolução: o primeiro estágio recupera área de xPU por meio de um PHY D2D compacto e da migração do controlador; o segundo estágio adiciona telemetria, teste, expansão de capacidade e unidades de processamento; e o terceiro estágio usa zHBM para eliminar interfaces bidimensionais e 2.5D, alcançando integração vertical direta da lógica xPU com a pilha de DRAM e máxima eficiência energética.

Estrutura de análise

O relatório começa com a divisão existente de responsabilidades entre o die central HBM e o die base e identifica gargalos de escalonamento relacionados a TSVs, PHYs, consumo de energia e dimensões de encapsulamento. Em seguida, usa mudanças geracionais em processos e interfaces do HBM2 ao HBM4E para demonstrar a necessidade de adotar processos lógicos avançados. Depois, sob as restrições de área, comprimento de canal, energia por bit, densidade de potência e pontos quentes térmicos, avalia sequencialmente interfaces D2D, HPB, migração de controlador de memória, reparo SRAM, RAS e testes, expansão de capacidade, computação próxima à memória e integração 3D, formando por fim um roteiro arquitetural de três estágios.

Notas metodológicas

  • (Método Fora do Vocabulário)Outro

    Roteiro de Evolução Arquitetural em Três Estágios

    O relatório divide a evolução do die base em três estágios — recuperação de área de xPU, expansão funcional adicional e verdadeira integração 3D — para explicar a sequência de implementação e as dependências entre as tecnologias.

  • (Método Fora do Vocabulário)Outro

    Comparação de Parâmetros Geracionais de HBM

    O relatório compara os anos e processos de HBM2 a HBM4E, assim como as velocidades de I/O e densidades de potência de sHBM4E e sHBM5, para identificar a inflexão criada por processos lógicos avançados e as novas restrições térmicas resultantes.

  • (Método Fora do Vocabulário)Outro

    Trade-off em Nível de Sistema entre Energia, Área, Largura de Banda e Dissipação de Calor

    Em vez de examinar apenas o chip de memória, o relatório avalia simultaneamente como interfaces mais curtas, migração funcional e integração vertical afetam a área de xPU, a movimentação de dados, a energia de I/O, a densidade térmica local e a margem para desempenho do sistema.

Dados principais

  • Linha do Tempo da Evolução de Processo HBM2016 HBM2; 2019 HBM2E; 2021 HBM3; 2023 HBM3E; 2026 HBM4; 2027 HBM4EGerações HBM e anos apresentados no relatório
  • Processo do Die Base HBM4/4E4nmO processo do die base anteriormente evoluiu de 2*nm para 1*nm entre HBM2 e HBM3E
  • Processo do Die Central HBM4D1c/1*nmO relatório afirma que a Samsung usa DRAM D1c e um die base lógico de 4nm no HBM4
  • Evolução de Processo do SoC xPU16n/12nm em 2016; 8n/4nm em 2019; 4nm em 2021—2023; 3nm em 2026; <3nm em 2027Correspondente ao roteiro de HBM2 até HBM4E
  • Velocidade de I/O sHBM4E14GbpsBase para a comparação de densidade térmica com sHBM5
  • Velocidade de I/O sHBM5>28GbpsAproximadamente 2 vezes a do sHBM4E
  • Densidade de Potência do PHY0.5W/mm² para sHBM4E; >2.0W/mm² para sHBM5O risco de pontos quentes térmicos aumenta à medida que o PHY diminui e acelera
  • Redução da Temperatura de Pico do HPB>35%Quando a cobertura do PHY é >50%
  • Taxa de Crescimento da Janela de Contexto de IA30 vezes/anoUsada no relatório para ilustrar o rápido crescimento dos requisitos de cache KV e capacidade de memória
  • Configuração de Comparação de Sistema zHBM1 GPU + 4 HBM4E, comparado com 1 GPU + 4 zHBMO relatório não fornece resultados quantitativos específicos para essa comparação

Impacto e implicações

O relatório argumenta que as dimensões da competição em HBM se expandirão para além da largura de banda, incluindo eficiência energética de interface, utilização de área de xPU, RAS, testes, expansão de capacidade e computação próxima à memória. Dies base de lógica avançada permitem que mais funções de sistema sejam implantadas mais perto da DRAM, enquanto o zHBM amplia ainda mais o escopo de otimização de um dispositivo de memória individual para o nível arquitetural conjunto de xPU, DRAM e encapsulamento. Consequentemente, dissipação de calor, ligação de densidade ultralta e recursos unificados de design e verificação se tornarão restrições críticas para a realização desses benefícios.

Riscos

  • Limitações físicas envolvendo contagem e passo de TSVs, contagem e velocidade de I/O PHY, e dimensões de retículo e interposer podem restringir a expansão adicional da largura de banda no HBM convencional.
  • A redução da área de PHY aumenta a densidade de potência e cria pontos quentes térmicos; o relatório mostra que a densidade de potência do PHY sHBM5 excede 2.0W/mm².
  • A implantação de unidades de processamento no die base está sujeita às restrições duplas de área de silício disponível limitada e aumento da densidade térmica local.
  • A implementação de zHBM depende de ligação wafer a wafer, ligação híbrida de cobre e um fluxo unificado de design e verificação SoC—DRAM.

Pontos a observar

  • Monitorar se o HPB pode atingir sua meta de mais de 50% de cobertura de PHY e sustentar uma redução de temperatura de pico superior a 35% em velocidades de I/O HBM5 acima de 28Gbps.
  • Monitorar o progresso na portabilidade de controladores de memória HBM convencionais para o die base cHBM.
  • Monitorar a integração prática de expansão de memória externa no die base, sensores RAS no chip, autoteste e unidades de processamento.
  • Monitorar como WoW, ligação híbrida de cobre e um fluxo unificado de design e verificação SoC—DRAM suportam zHBM.

Configurações

Entre para ver os logins recentes