Interpretação de relatórios
Cobertura das pesquisas mais recentes dos principais bancos de investimento de Wall Street
Interpretação do relatórioHilo Research

Memória de Semicondutores e Encapsulamento Avançado: A HBM eleva o teto de largura de banda de memória para sistemas de IA, com encapsulamento avançado, gerenciamento térmico e confiabilidade tornando-se críticos para a próxima etapa de expansão

A Micron acredita que a expansão contínua dos modelos de IA está tornando a largura de banda de memória um gargalo de desempenho do sistema. A HBM reduz significativamente a lacuna entre computação e memória por meio de alto paralelismo, interfaces amplas e empilhamento 3D. A HBM4 aumenta ainda mais a largura de banda e a capacidade, mas também introduz maior consumo de silício, complexidade de encapsulamento, desafios de gerenciamento térmico e confiabilidade.

InstituiçãoMicron
EmpresaArquiteturas de Memória em Evolução para IA (HBM)
SetorMemória de Semicondutores e Encapsulamento Avançado

Resumo

A Micron acredita que a expansão contínua dos modelos de IA está tornando a largura de banda de memória um gargalo de desempenho do sistema. A HBM reduz significativamente a lacuna entre computação e memória por meio de alto paralelismo, interfaces amplas e empilhamento 3D. A HBM4 aumenta ainda mais a largura de banda e a capacidade, mas também introduz maior consumo de silício, complexidade de encapsulamento, desafios de gerenciamento térmico e confiabilidade.

—
HBMComputação Acelerada por IAParede de MemóriaDRAMEncapsulamento AvançadoSistema em EncapsulamentoGerenciamento TérmicoConfiabilidadeInterconexões de Alta Velocidade
  • O modelo Roofline mostra que a HBM eleva o teto de largura de banda de memória, permitindo que cargas de trabalho de IA intensivas em memória alcancem desempenho mais alto antes de atingir o gargalo.
  • Nos sistemas de exemplo, oito pilhas HBM3 fornecem 5.3 TB/s de largura de banda teórica, em comparação com 307 GB/s para um sistema DDR5 de oito canais.
  • A HBM4 tem largura de banda nominal de 2800 GB/s, com a contagem de canais aumentando para 32 e as I/Os de dados aumentando para 2048.
  • Fornecer capacidade HBM3E consome aproximadamente três vezes mais silício do que DDR5, refletindo o custo combinado da complexidade de projeto, encapsulamento e fabricação.
  • No recorde de pré-treinamento de 54 dias do Llama 3 405B, aproximadamente 78% das interrupções inesperadas foram atribuídas a problemas de hardware confirmados ou suspeitos.
  • Velocidades D2D mais altas, pilhas mais altas, resfriamento líquido, ligação híbrida e interposers maiores são direções tecnológicas importantes para a expansão subsequente.

Interpretação do relatório

Visão geral

Este é um relatório técnico sobre arquitetura de memória para IA publicado pela Micron. Ele se concentra em explicar por que a memória se tornou uma restrição central para grandes modelos e computação acelerada, e como a HBM atenua a “parede de memória” por meio de alta largura de banda, alto paralelismo e integração heterogênea. O relatório também analisa a evolução da HBM1 à HBM4 e discute desafios futuros envolvendo interconexões de alta velocidade, encapsulamento avançado, gerenciamento térmico e confiabilidade.

Visões principais

O relatório começa com as leis de escalonamento de grandes modelos: o desempenho de modelos de linguagem melhora de forma contínua à medida que o tamanho do modelo, o tamanho do conjunto de dados e a computação de treinamento aumentam, mas os três devem escalar em conjunto, e um gargalo em qualquer fator limitará os ganhos gerais. À medida que o desempenho computacional das GPUs continua a aumentar, a “parede de memória”, causada pelo fato de os dados não chegarem aos processadores com rapidez suficiente, torna-se cada vez mais evidente. Portanto, a memória evoluiu de um componente de suporte para um fator central que determina se o desempenho dos sistemas de IA pode continuar a escalar. O relatório usa o modelo Roofline para explicar essa restrição. O modelo mede o desempenho alcançável em operações por segundo e a intensidade aritmética em operações por byte. Aplicações com baixa intensidade aritmética operam na região limitada por memória, onde o desempenho é determinado pela largura de banda da memória, enquanto aplicações com alta intensidade aritmética têm maior probabilidade de serem limitadas pela capacidade computacional. A HBM eleva o teto de largura de banda da memória, permitindo que cargas de trabalho de IA intensivas em memória alcancem desempenho mais alto antes de atingir o limite de largura de banda e, assim, servindo como uma “ponte entre computação e memória” entre a capacidade de computação e a capacidade de entrega de dados. A HBM alcança alto paralelismo por meio de múltiplos canais independentes, I/O ampla, conexões ponto a ponto de curta distância e empilhamento 3D. Cada matriz DRAM contém múltiplos canais independentes, e cada canal possui dois pseudocanais que compartilham barramentos de comando e endereço, mas usam barramentos de dados independentes. A matriz base gerencia as interfaces de comando e dados entre o host e a DRAM, o PHY de micro-bumps conecta o host à matriz base, e o PHY TSV 3D conecta a pilha DRAM à matriz base. A HBM3E possui 128 bancos por matriz, aumentando para 256 na HBM4. As conexões de interposer de alta densidade aumentam de aproximadamente 1K I/Os na HBM3E para aproximadamente 2K I/Os na HBM4. As especificações geracionais mostram que a HBM continua a evoluir em largura de banda, número de canais e capacidade. Os respectivos marcos para HBM1, HBM2, HBM2E, HBM3, HBM3E e HBM4 são 2014, 2018, 2020, 2022, 2024 e 2026. Suas contagens de canais são 8, 8, 8, 16, 16 e 32, respectivamente; as contagens de pseudocanais são nenhum, 16, 16, 32, 32 e 64; e as larguras de pseudocanal são 128, 64, 64, 32, 32 e 32 bits. O comprimento de rajada aumentou de 2 na HBM1 para 4 na HBM2 e HBM2E, e então para 8 a partir da HBM3. A largura de pré-busca é de 256 bits em todas as gerações. O número de I/Os de dados permaneceu em 1024 da HBM1 até a HBM3E e aumentou para 2048 na HBM4. As taxas nominais de dados correspondentes da HBM1 à HBM4 são 1, 2.4, 3.6, 6.4, 8 e 11 Gbps, enquanto as larguras de banda nominais são 128, 307, 460, 819, 1024 e 2800 GB/s. As densidades de DRAM são 2, 8, 16, 16, 24 e 24 Gb, respectivamente. A altura da pilha evoluiu de quatro camadas na HBM1 para quatro/oito camadas na HBM2 e HBM2E, oito/12 camadas na HBM3 e oito ou mais camadas na HBM3E e HBM4. A capacidade por pilha, consequentemente, aumentou de 1 GB para 4/8 GB, 8/16 GB e 16/24 GB, alcançando 24 GB ou mais na HBM3E e HBM4. Cada geração eleva simultaneamente a taxa de dados, o número de pseudocanais, a densidade e a altura da pilha para melhorar, respectivamente, a largura de banda, a granularidade de acesso, a eficiência e a capacidade. A comparação de sistemas ilustra ainda mais a vantagem de largura de banda da HBM. Um sistema de exemplo que usa oito canais DDR5 possui largura de banda teórica de 307 GB/s a 4800 MT/s, com dois subcanais de 32 bits por canal. Supondo dois ranks por canal e 64 GB por DIMM, a capacidade total pode alcançar 1 TB. Outro sistema de exemplo, composto por oito pilhas HBM3, possui largura de banda teórica de 5.3 TB/s a 5.2 Gbps, com 16 canais por pilha e dois pseudocanais de 32 bits por canal. Com 24 GB por pilha, a capacidade total é de 192 GB. As duas arquiteturas refletem prioridades diferentes: DIMMs convencionais fornecem maior capacidade, enquanto a HBM troca capacidade por um aumento de uma ordem de magnitude na largura de banda do sistema ao ser posicionada próxima à GPU e ampliar a interface paralela. No nível do núcleo, 256 I/Os operando a 8 Gbps podem fornecer 256 GB/s de largura de banda, enquanto oito I/Os operando a 8 Gbps fornecem apenas 8 GB/s. A comparação de contagem de bancos no exemplo é de 128 versus 32. Ao mesmo tempo, o desempenho da HBM não ocorre sem custos de recursos: a combinação de projeto arquitetônico, encapsulamento avançado e complexidade de fabricação significa que fornecer capacidade equivalente de HBM3E consome aproximadamente três vezes mais silício do que DDR5. Consequentemente, o escalonamento de HBM não é apenas uma questão de processo de DRAM; ele também depende da otimização coordenada da tecnologia de encapsulamento, circuitos de I/O, processos de interposer e processos CMOS. O relatório resume os requisitos de memória de IA em quatro áreas: desempenho, capacidade, escalabilidade e baixo consumo de energia. O desempenho abrange não apenas velocidade e largura de banda, mas também confiabilidade e tolerância a falhas. A capacidade é necessária para armazenar parâmetros de modelos, arquivos e caches. O baixo consumo de energia afeta a eficiência energética e a implantação de dispositivos de borda de IA. À medida que surgem I/O de maior velocidade e projetos maiores de sistema em encapsulamento, as direções futuras de inovação incluem PHYs SERDES D2D otimizados para memória, óptica co-empacotada (CPO), SiPs maiores do tipo CoWoS-L ou CoWoS-R e substratos de vidro. Essas tecnologias expandem a conectividade e reduzem perdas em links de alta velocidade, mas também aumentam a dificuldade do codesign de sistemas. A interação entre chip e encapsulamento é outro desafio fundamental. Dispositivos HBM complexos e integrados de forma heterogênea usam múltiplos materiais cujos coeficientes de expansão térmica incompatíveis podem gerar tensão termomecânica, afetando a integridade estrutural e a confiabilidade de longo prazo. Confiabilidade, disponibilidade e capacidade de manutenção também afetam diretamente o treinamento em larga escala. O registro de pré-treinamento do Llama 3 405B citado no relatório abrange 54 dias, durante os quais aproximadamente 78% das interrupções inesperadas foram atribuídas a problemas de hardware confirmados ou suspeitos. Estes incluíram 148 incidentes de falha de GPU, correspondendo a 30.1%; 72 incidentes de memória HBM3 de GPU, correspondendo a 17.2%; 54 defeitos de software, correspondendo a 12.9%; 35 incidentes de switch de rede ou cabo, correspondendo a 8.4%; 32 incidentes de manutenção não planejada de host, correspondendo a 7.6%; 19 incidentes de memória SRAM de GPU, correspondendo a 4.5%; e 17 incidentes de processador de sistema de GPU, correspondendo a 4.1%. Esses dados mostram que o desempenho de clusters de IA depende não apenas da largura de banda máxima, mas também da estabilidade do hardware de memória e computação durante operações prolongadas. Para lidar com questões de confiabilidade, a HBM3 passou a fornecer dois níveis de cobertura ECC. A cobertura em nível de sistema fornece 16 bits de metadados para cada acesso de 256 bits, permitindo que o sistema aplique CRC ou ECC. A cobertura em nível de matriz implementa ECC Reed-Solomon baseado em símbolos dentro da DRAM. O relatório argumenta que tal proteção de ponta a ponta é um componente importante para permitir que a HBM suporte treinamento contínuo e computação de alta disponibilidade. O gerenciamento térmico se tornará mais difícil à medida que aumentam as interconexões D2D de alta velocidade, a funcionalidade da matriz base, a atividade das matrizes DRAM e a altura da pilha. O relatório identifica o resfriamento líquido e a ligação híbrida como importantes medidas de resposta e observa ainda que o encapsulamento avançado deve avançar simultaneamente no escalonamento de I/O de densidade de área, incluindo micro-bumps, pads e TSVs; no escalonamento lateral de I/O, incluindo larguras de linha e espaçamento mais finos; no particionamento de arrays e CMOS; e no gerenciamento de hotspots e da rede de fornecimento de energia. As rotas de empilhamento e ligação incluem CoS, CoW, C2C, C2W, W2W, micro-bumps, ligação por fusão e ligação híbrida, indicando que futuros ganhos de desempenho da HBM dependerão de estreita colaboração entre os ecossistemas de memória, lógica, encapsulamento, gerenciamento térmico e fabricação. O relatório conclui observando que o ChatGPT alcançou 100 milhões de usuários em apenas dois meses para ilustrar a velocidade com que as aplicações de IA estão proliferando e, com base nisso, enfatiza que o setor está passando por uma fase inédita de aceleração. Sua conclusão central é que a HBM se tornou um componente fundamental da computação acelerada por IA, mas aumentos contínuos de largura de banda e capacidade não podem depender apenas de atualizações em tecnologias individuais de memória. Desafios envolvendo interconexões de alta velocidade, tamanho do encapsulamento, tensão dos materiais, densidade térmica, correção de erros e capacidade de manutenção do sistema também devem ser enfrentados em paralelo.

Estrutura de análise

O relatório segue a seguinte sequência: requisitos de escalonamento de IA, gargalos de memória, princípios de funcionamento da HBM, evolução das especificações geracionais, comparações em nível de sistema, encapsulamento e interconexões, e desafios de confiabilidade e gerenciamento térmico. Primeiro, ele usa as leis de escalonamento de grandes modelos e o modelo Roofline para explicar por que a largura de banda limita o desempenho; em seguida, quantifica as diferenças usando tabelas de especificações da HBM1 à HBM4, exemplos de sistemas DDR5 e HBM e dados de causas-raiz de interrupções de treinamento. Por fim, propõe as direções tecnológicas necessárias para a expansão contínua a partir das perspectivas de chips, encapsulamento, materiais, gerenciamento térmico e correção de erros.

Notas metodológicas

  • (Método Fora da Taxonomia)Outro

    Modelo de Desempenho Roofline

    Este modelo relaciona o desempenho computacional alcançável à intensidade aritmética e é usado para distinguir se as cargas de trabalho são restringidas pela largura de banda da memória ou pela capacidade computacional. O relatório o utiliza para explicar como a HBM eleva o teto de largura de banda e melhora o desempenho de tarefas de IA intensivas em memória.

  • (Método Fora da Taxonomia)Outro

    Leis de Escalonamento de Grandes Modelos

    O relatório cita o princípio empírico de que o tamanho do modelo, o tamanho do conjunto de dados e a computação de treinamento devem escalar em conjunto para explicar como a memória se torna um gargalo para melhorias adicionais no desempenho da IA se não for atualizada junto com a capacidade computacional.

  • (Método Fora da Taxonomia)Outro

    Comparação de Especificações Geracionais e Arquitetura de Sistema

    O relatório compara os canais, I/Os, taxas, largura de banda, densidade e capacidade da HBM1 à HBM4 e coloca um sistema DDR5 de oito canais ao lado de um sistema HBM3 de oito pilhas para demonstrar suas diferentes prioridades de capacidade e largura de banda.

  • (Método Fora da Taxonomia)Outro

    Classificação de Causas-Raiz de Interrupções Inesperadas

    O relatório categoriza interrupções durante o pré-treinamento prolongado de grandes modelos por GPU, memória HBM3, software, rede, manutenção de host e outras causas para ilustrar como a confiabilidade do hardware afeta o tempo operacional efetivo dos clusters de IA.

Dados principais

  • Cronologia Geracional da HBMHBM1 2014; HBM2 2018; HBM2E 2020; HBM3 2022; HBM3E 2024; HBM4 2026Marcos de evolução de produto apresentados no relatório
  • Largura de Banda Nominal da HBM128, 307, 460, 819, 1024, 2800 GB/sCorrespondendo, respectivamente, a HBM1, HBM2, HBM2E, HBM3, HBM3E e HBM4
  • Taxa de Dados Nominal da HBM1, 2.4, 3.6, 6.4, 8, 11 GbpsCorrespondendo, respectivamente, da HBM1 à HBM4
  • Canais e I/O da HBM432 canais, 64 pseudocanais e 2048 I/Os de dadosA HBM3E possui 16 canais, 32 pseudocanais e 1024 I/Os de dados, respectivamente
  • Sistema de Exemplo DDR5307 GB/s de largura de banda teórica e 1 TB de capacidadeOito canais, 4800 MT/s e dois subcanais de 32 bits por canal; dois ranks por canal e 64 GB por DIMM
  • Sistema de Exemplo HBM35.3 TB/s de largura de banda teórica e 192 GB de capacidadeOito pilhas, 5.2 Gbps, 16 canais por pilha e 24 GB de capacidade por pilha
  • Consumo de Silício da HBM3EAproximadamente três vezes o do DDR5O relatório atribui isso à sobrecarga combinada de projeto arquitetônico, encapsulamento avançado e complexidade de fabricação
  • Participação do Hardware nas Interrupções Inesperadas de TreinamentoAproximadamente 78%Atribuída a problemas de hardware confirmados ou suspeitos durante 54 dias de pré-treinamento do Llama 3 405B
  • Principais Categorias de InterrupçãoGPUs com falha: 148 incidentes, 30.1%; memória HBM3 de GPU: 72 incidentes, 17.2%; defeitos de software: 54 incidentes, 12.9%As três principais categorias de causas-raiz de interrupções inesperadas apresentadas no relatório
  • Metadados de Correção de Erros em Nível de Sistema da HBM316 bits de metadados configurados para cada acesso de 256 bitsO sistema pode usar CRC ou ECC; ECC Reed-Solomon em nível de matriz também é fornecido
  • Velocidade de Adoção de Usuários do ChatGPTAlcançou 100 milhões de usuários em 2 mesesUsado no relatório para ilustrar a velocidade de adoção de aplicações de IA

Impacto e implicações

O relatório argumenta que o projeto de sistemas de IA está migrando de uma busca singular pelo desempenho computacional máximo de GPU para a otimização coordenada de computação, memória, interconexões e encapsulamento. A HBM pode aumentar significativamente a velocidade de entrega de dados, mas maior largura de banda e capacidade também elevam o consumo de silício, a densidade de I/O, a altura da pilha e a carga térmica. Portanto, a futura expansão de desempenho depende de encapsulamento avançado, D2D de alta velocidade, resfriamento líquido, ligação híbrida, ECC e colaboração intersetorial poderem avançar em conjunto.

Riscos

  • Se a largura de banda de memória não puder escalar em conjunto com o tamanho do modelo e a capacidade computacional, os processadores não conseguirão utilizar plenamente seu poder de computação enquanto aguardam dados.
  • Coeficientes de expansão térmica incompatíveis entre diferentes materiais no encapsulamento heterogêneo de HBM podem gerar tensão termomecânica, criando riscos de interação entre chip e encapsulamento.
  • Aumentos nas interconexões de alta velocidade, na funcionalidade da matriz base, na atividade da DRAM e na altura da pilha elevarão a densidade térmica e tornarão a dissipação de calor mais difícil.
  • O treinamento prolongado de IA é altamente sensível à confiabilidade do hardware; aproximadamente 78% das interrupções inesperadas no registro de treinamento de 54 dias citado estiveram associadas a problemas de hardware confirmados ou suspeitos.
  • A capacidade HBM3E requer aproximadamente três vezes mais silício do que DDR5, enquanto o projeto avançado, o encapsulamento e a complexidade de fabricação criam desafios de recursos e produção.

Pontos a observar

  • Se os 32 canais, 64 pseudocanais, 2048 I/Os e 2800 GB/s de largura de banda nominal da HBM4 podem suportar a próxima etapa das cargas de trabalho de IA.
  • Progresso em PHYs SERDES D2D otimizados para memória, óptica co-empacotada e interposers SiP maiores.
  • Melhorias do resfriamento líquido e da ligação híbrida para resolver problemas de gerenciamento térmico causados por maior atividade de DRAM e pilhas mais altas.
  • A evolução de tecnologias de encapsulamento avançado, como micro-bumps, TSVs, escalonamento de largura de linha e espaçamento, e substratos de vidro.
  • Melhorias na confiabilidade e capacidade de manutenção do treinamento de IA provenientes de CRC ou ECC em nível de sistema e ECC Reed-Solomon em nível de matriz.

Configurações

Entre para ver os logins recentes