Acelerador de Inferência Generativa d-Matrix Raptor 3D-DRAM: Raptor Usa 3D-DRAM para Superar os Gargalos de Largura de Banda de Memória e Energia da Inferência Generativa
O relatório apresenta o silício inicial do d-Matrix Raptor e seu codesign com 3D-DRAM: 32 GB de capacidade e 100 TB/s de largura de banda por placa, com bloqueio de fluxo, DBI sem pinos e mecanismos de confiabilidade sensíveis à temperatura que abordam overfetch, consumo de energia de I/O e problemas de atualização em alta temperatura.
Resumo
O relatório apresenta o silício inicial do d-Matrix Raptor e seu codesign com 3D-DRAM: 32 GB de capacidade e 100 TB/s de largura de banda por placa, com bloqueio de fluxo, DBI sem pinos e mecanismos de confiabilidade sensíveis à temperatura que abordam overfetch, consumo de energia de I/O e problemas de atualização em alta temperatura.
- Os pesos do modelo e o cache KV crescem simultaneamente; com 64 usuários e comprimento de contexto de 1 milhão por usuário, o cache KV é de aproximadamente 935 GB.
- Uma placa Raptor consiste em oito chiplets, fornecendo 32 GB de capacidade e 100 TB/s de largura de banda; um rack de 72 placas alcança 2,3 TB e 7,2 PB/s.
- O bloqueio de fluxo reduz o overfetch de 33% causado pelo mapeamento de três bancos para 0%, recuperando aproximadamente 33 TB/s de largura de banda.
- A inversão de fluxo implementa DBI sem pinos com 0,8% de sobrecarga de metadados, e o relatório afirma que ela pode economizar 20% da energia de I/O.
- O relatório afirma que, em vários modelos de linguagem e fala, o Raptor 3D-DRAM oferece 4,71x e 2,44x o throughput de soluções baseadas em HBM e SRAM, respectivamente.
Interpretação do relatório
Visão geral
Partindo da tensão entre capacidade, largura de banda e consumo de energia na inferência generativa, o relatório explica como o d-Matrix Raptor empilha diretamente dies lógicos sobre DRAM e projeta conjuntamente mapeamento de memória, transmissão de dados, atualização térmica, correção de erros e mecanismos de redundância para usar 3D-DRAM em inferência de baixa latência e contexto longo.
Visões principais
A escala de dados na inferência generativa está se expandindo simultaneamente em ambas as direções: os pesos dos modelos continuam a crescer, enquanto o cache KV aumenta com o comprimento do contexto e o número de usuários simultâneos. O relatório dá o exemplo de que, com 64 usuários e comprimento de contexto de 1 milhão por usuário, o cache KV é de aproximadamente 935 GB. A etapa de prefill da inferência é geralmente limitada pelo throughput computacional, enquanto a decodificação autorregressiva é geralmente limitada pela largura de banda de memória; em cenários de baixa latência e pequenos lotes, a decodificação responde pelo tempo de execução crítico. GQA elevado e decodificação especulativa podem tornar a computação de atenção limitada por computação, mas MoE pode permanecer limitada pela largura de banda de memória mesmo com tamanhos de lote moderados e decodificação especulativa, de modo que capacidade e largura de banda devem escalar simultaneamente. O relatório argumenta que os dois tipos existentes de memória possuem deficiências claras. A SRAM on-chip oferece latência inferior a nanossegundo; um par de placas exemplificativo pode fornecer aproximadamente 300 TB/s de largura de banda, 4 GB de capacidade, aproximadamente 1 ns de latência e aproximadamente 0,5 pJ/bit de consumo de energia de I/O. Contudo, sua célula de armazenamento 6T ocupa aproximadamente 10 vezes a área de uma célula DRAM 1T1C, a área da célula de bits dos nós N5 a N2 permanece em aproximadamente 0,021 µm², o vazamento para capacidade em escala de gigabytes pode atingir dezenas de watts, a capacidade prática é de aproximadamente 4 GB e o custo é aproximadamente 100 vezes o da DRAM. HBM oferece alta capacidade, mas é limitada pelo espaço na borda do encapsulamento, contagem de pilhas, velocidade de pinos e largura de I/O; o relatório estima que o teto prático de largura de banda de um sistema HBM4 seja aproximadamente 20 TB/s. Se a HBM fosse elevada a 100 TB/s a 2,4 pJ/bit, somente a energia da memória exigiria 1,92 kW, excluindo a energia de interconexão. A abordagem central do Raptor é empilhar logic e DRAM face a face, substituindo caminhos de interposer em escala de centímetros com PHYs por conexões verticais em escala de milímetros. O relatório indica consumo de energia de I/O vertical 3D de aproximadamente 0,3–0,4 pJ/bit, cerca de uma ordem de magnitude inferior ao HBM; a estimativa específica da interface é de 0,37 pJ/bit, contra aproximadamente 2–3 pJ/bit para HBM4. O Raptor usa uma camada lógica superior TSMC N4/N4P, uma camada inferior de 3D-DRAM e empilhamento face a face com passo de 36 µm. Cada chiplet fornece 4 GB de capacidade, 12,5 TB/s de largura de banda e 840 microbancos DRAM; oito chiplets formam uma placa de 32 GB e 100 TB/s, quatro placas formam um sistema de 128 GB e 400 TB/s, e 18 bandejas totalizando 72 placas alcançam 2,3 TB de capacidade e 7,2 PB/s de largura de banda. As estimativas de carregamento de modelos assumem pesos de 4 bits, cache KV de 8 bits e um domínio de escalabilidade de 72 placas. GLM 5.2 contém 744 bilhões de parâmetros totais e 40 bilhões de parâmetros ativos, exigindo 44,7 GB de cache KV por usuário com comprimento de contexto de 1 milhão; Kimi K3 contém 2,8 trilhões de parâmetros totais e aproximadamente 102 bilhões de parâmetros ativos, exigindo 11,7 GB de cache KV por usuário. O relatório afirma que 72 placas Raptor, cada uma com 32 GB, podem acomodar Kimi K3 com comprimento de contexto de 1 milhão, com implantação desagregada e múltiplos racks permitindo maior escalabilidade; sua conclusão afirma ainda que um único rack Raptor atendendo a um modelo de aproximadamente 3 trilhões de parâmetros com comprimento de contexto de 1 milhão pode fornecer de forma sustentável aproximadamente 1.000 TPS por usuário. A alta largura de banda só pode se traduzir em desempenho efetivo quando computação, memória e interconexão são projetadas conjuntamente. Por meio de sharding e comunicação coletiva, o Raptor deve coordenar aproximadamente 8.000 dispositivos virtuais em uma rede hierárquica, em comparação com aproximadamente 72 dispositivos em um sistema típico de GPU; portanto, baixa latência é necessária para evitar limitações impostas pela lei de Amdahl. O relatório adota uma topologia full-mesh dentro do encapsulamento, usando links diagonais virtuais para reduzir a latência interna do encapsulamento, evitando ao mesmo tempo a maior distância, o consumo de energia D2D e a quantidade de camadas do encapsulamento associadas a diagonais físicas. Os protocolos intra-placa e interplaca usam transferências push unidirecionais iniciadas pelo dispositivo que não exigem confirmação da placa de origem, suportando múltiplas transferências paralelas de mensagens curtas. O primeiro desafio específico de integração é o mapeamento banco-canal. Cada acesso do mecanismo de computação requer 128 B de dados, enquanto cada acesso à coluna de um banco pode retornar apenas 32 B; portanto, cada canal teoricamente requer quatro bancos. Um chiplet possui 256 canais e a DRAM possui 840 bancos; após subtrair 72 bancos sobressalentes, restam apenas 768 bancos utilizáveis, ou três por canal. Realizar diretamente dois acessos lê 192 B para um único flit de 128 B, causando 33% de overfetch e desperdiçando aproximadamente 33 TB/s. Um esquema simples de escalonamento de colunas requer um buffer de deslocamento de 192 B e aumenta a dificuldade de fechamento de temporização e verificação. O Raptor usa “bloqueio de fluxo”: o quarto acesso parcial de 32 B é compartilhado entre três flits, de modo que 4×96 B de entrada formam exatamente 3×128 B de saída, reduzindo o overfetch a 0%, utilizando plenamente cada acesso de coluna e recuperando aproximadamente 33 TB/s de largura de banda. O segundo desafio é o consumo de energia de I/O. A 100 TB/s e 0,37 pJ/bit, o próprio I/O consome aproximadamente 296 W. A inversão de barramento de dados HBM tradicional depende de rajadas de múltiplos ciclos, conhecimento prévio da rajada completa e pinos DBI dedicados; a interface 3D-DRAM do Raptor usa transferências de 256 bits em ciclo único, sem rajadas ou pinos de banda lateral, de modo que esse mecanismo não pode ser reutilizado diretamente. Seu esquema de “inversão de fluxo” compara flits adjacentes por canal: durante escritas, ele inverte o flit atual quando a inversão resulta em menos transições de bits e, durante leituras, restaura os dados usando uma tag de 1 bit armazenada junto com ECC. O relatório afirma que o esquema incorre em apenas 0,8% de sobrecarga, não requer modificações no PHY e pode reduzir a energia de I/O em 20%. O terceiro desafio é a confiabilidade em uma temperatura de junção de 105°C. O tempo de retenção padrão de DRAM é de 32 ms a 85°C, mas cai para 4 ms a 105°C, implicando aumento de oito vezes na frequência de atualização; altas temperaturas também aumentam erros leves, enquanto os riscos de rendimento decorrentes de 840 bancos, assimetria de canal causada por um único banco com falha e a disputa entre ECC, scrubbing e atualização pelo throughput devem ser todos tratados simultaneamente. O Raptor aproveita sua estrutura de bancos profundos, que possui 16–32 vezes menos linhas, de modo que o custo de largura de banda da atualização de 4 ms é de apenas 1,37%, permitindo sustentar aproximadamente 100 TB/s; as oito localizações finais de coluna armazenam códigos de correção de erros Reed–Solomon intercalados [132,128] e bits DBI. Setenta e dois microbancos redundantes online usam uma cadeia de bancos de dois níveis para lidar com até duas falhas em localizações arbitrárias, com bancos sobressalentes preenchendo as lacunas, preservando assim a largura simétrica do canal e acrescentando custo de roteamento negligenciável. Em uma comparação baseada em área de silício e largura de banda efetiva, a densidade de capacidade do Raptor é de 11,4 MB/mm², abaixo de 21,9 para HBM4 24 Gb, 26,3 para HBM4 32 Gb e 21,9 MB/mm² para Rubin R200; contudo, sua densidade de largura de banda é de 32,6 GB/s/mm², significativamente acima dos respectivos 1,67, 1,51 e 1,39 GB/s/mm². O consumo de energia do Raptor por GB/s é de 2,96 mW, contra 40,0 mW para todos os alvos de comparação; essa comparação assume utilização efetiva de largura de banda de 83% para Raptor e 85% para Rubin. Portanto, o relatório enfatiza que inferência de baixa latência não exige necessariamente capacidade máxima por placa, sendo mais adequada uma capacidade moderada combinada com largura de banda extremamente alta. Os materiais de silício inicial afirmam ainda que, em modelos incluindo Llama-3.1 70B, DeepSeek-V3, Kimi K2, GPT-OS, Whisper e Canary, o Raptor 3D-DRAM oferece 4,71x o throughput de soluções baseadas em HBM e 2,44x o de soluções baseadas em SRAM, sendo também menos sensível à latência e à largura de banda da rede.
Estrutura de análise
O relatório primeiro decompõe os gargalos da inferência generativa nas etapas de prefill e decodificação, depois compara SRAM, HBM e 3D-DRAM em termos de capacidade, largura de banda, latência, consumo de energia de I/O e restrições de encapsulamento. Em seguida, estima a capacidade e a largura de banda dos modelos desde o nível de chiplet até placas, bandejas e um rack de 72 placas, analisando um a um mapeamento de bancos, consumo de energia de I/O, atualização em alta temperatura, ECC e problemas de redundância. Por fim, valida os trade-offs de projeto comparando utilização efetiva de largura de banda, métricas por unidade de área de silício, consumo de energia por unidade de largura de banda e throughput em múltiplos modelos.
Notas metodológicas
Correspondência entre Requisitos de Dados de Inferência e Capacidades de Memória
O relatório trata o crescimento dos pesos dos modelos e do cache KV como demanda por capacidade e largura de banda e, em seguida, compara essa demanda com a capacidade, largura de banda e consumo de energia que SRAM, HBM e 3D-DRAM podem fornecer para determinar qual arquitetura de memória é mais adequada para inferência de contexto longo.
Decomposição de Gargalos de Prefill–Decodificação
O relatório divide o processo de inferência em uma etapa de prefill, geralmente limitada pelo throughput computacional, e uma etapa de decodificação, geralmente limitada pela largura de banda de memória, para explicar qual parcela do tempo de execução a 3D-DRAM de alta largura de banda aborda principalmente.
Codesign de Hardware, Arquitetura e Carga de Trabalho
Em vez de tratar a 3D-DRAM como armazenamento externo, o relatório projeta conjuntamente mapeamento de bancos, fluxo de dados, protocolos de interconexão, atualização, correção de erros e redundância para que a largura de banda bruta fornecida pelo empilhamento físico possa ser convertida em throughput efetivo de inferência.
Comparação Normalizada de Área de Silício e Largura de Banda Efetiva
O relatório compara Raptor, HBM4 e Rubin R200 por capacidade por milímetro quadrado, largura de banda por milímetro quadrado e consumo de energia por GB/s, incorporando utilização efetiva de largura de banda de 83% para Raptor e 85% para Rubin, para evitar comparar apenas especificações nominais.
Lei de Amdahl
O relatório usa essa lei para explicar que, mesmo que a largura de banda de memória aumente substancialmente, os componentes seriais ou de comunicação restantes ainda limitarão a aceleração global do sistema caso a latência de comunicação intra-placa ou interplaca não diminua adequadamente.
Mapeamento e comparação de ativos
Mapeamento estruturado da tese para ativos nomeados (pontos fortes, pontos fracos, pares e riscos).
- Acelerador de Inferência Generativa d-Matrix Raptor 3D-DRAMO relatório o posiciona como uma plataforma integrada de lógica e memória empilhada em 3D para inferência generativa de contexto longo e baixa latência.
- Pontos fortes
- 100 TB/s de largura de banda por placa, baixo consumo de energia de I/O, escalabilidade de chiplets a um rack de 72 placas e recursos projetados conjuntamente, incluindo bloqueio de fluxo, inversão de fluxo, atualização sensível à temperatura, ECC e cadeias de bancos.
- Pontos fracos
- A capacidade por placa é de 32 GB, e a densidade de capacidade por área de silício é de 11,4 MB/mm², abaixo das métricas HBM4 e Rubin R200 apresentadas no relatório; o sistema também deve coordenar aproximadamente 8.000 dispositivos virtuais.
- Comparação
- O relatório atribui ao Raptor densidade de largura de banda de 32,6 GB/s/mm² e consumo de energia por unidade de largura de banda de 2,96 mW/GB/s, contra 1,39–1,67 GB/s/mm² e 40,0 mW/GB/s, respectivamente, para os alvos de comparação; o throughput entre modelos é 4,71x e 2,44x superior ao de soluções baseadas em HBM e SRAM, respectivamente.
- Riscos
- Os riscos de integração incluem gerenciamento térmico e entrega de energia para empilhamento 3D, rendimento de microbumps, falhas de bancos, atualização e erros leves a 105°C, integridade de sinal em barramentos paralelos largos e latência de comunicação entre múltiplos chiplets e placas.
Dados principais
- Cache KV para 64 Usuários com Comprimento de Contexto de 1 MilhãoAproximadamente 935 GBIlustra como contexto longo e usuários simultâneos amplificam conjuntamente os requisitos de capacidade de memória.
- Especificações Exemplificativas de SRAM300 TB/s, 4 GB, aproximadamente 1 ns, aproximadamente 0,5 pJ/bitLargura de banda e latência excepcionais, mas capacidade, vazamento e custo restringem a escalabilidade.
- Teto Prático de Largura de Banda HBM4Aproximadamente 20 TB/sLimitado pelo espaço na borda do encapsulamento, contagem de pilhas e escalabilidade de I/O.
- Energia de Memória HBM a 100 TB/s1,92 kWCalculada a 2,4 pJ/bit e excluindo a energia de interconexão.
- Placa Raptor Única32 GB, 100 TB/sConsiste em oito chiplets 3D-DRAM, cada um fornecendo 4 GB e 12,5 TB/s.
- Rack Raptor de 72 Placas2,3 TB, 7,2 PB/sConsiste em 18 bandejas e 72 placas.
- Estimativa do Modelo GLM 5.2744B de parâmetros totais, 40B de parâmetros ativos, 44,7 GB KV/usuárioPressupõe um comprimento de contexto de 1 milhão.
- Estimativa do Modelo Kimi K32,8T de parâmetros totais, aproximadamente 102B de parâmetros ativos, 11,7 GB KV/usuárioSetenta e duas placas de 32 GB podem acomodar o modelo com comprimento de contexto de 1 milhão.
- Overfetch Original do Mapeamento de Bancos33%, aproximadamente 33 TB/sCom apenas três bancos por canal, ler diretamente um flit de 128 B requer buscar 192 B.
- Efeito do Bloqueio de Fluxo0% de overfetchApós o compartilhamento de acessos parciais, 384 B de entrada correspondem a 384 B de saída efetiva.
- Energia de I/O 3D-DRAM a 100 TB/s296 WCalculada a 0,37 pJ/bit.
- Efeito da Inversão de Fluxo20% de economia de energia, 0,8% de sobrecargaA tag é armazenada junto com ECC, não exigindo pinos adicionais de banda lateral PHY.
- Requisito de Atualização a 105°C32 ms reduzidos para 4 ms, com frequência de atualização aumentando oito vezesO projeto de bancos profundos limita o custo de largura de banda a 1,37%.
- Densidade de Largura de BandaRaptor 32,6 GB/s/mm²; HBM4 e Rubin R200 em 1,67, 1,51 e 1,39 GB/s/mm²Comparado com base na largura de banda efetiva.
- Consumo de Energia por Unidade de Largura de BandaRaptor 2,96 mW/GB/s; alvos de comparação 40,0 mW/GB/sMenor é melhor.
- Comparação de Throughput entre Modelos4,71x maior que HBM e 2,44x maior que SRAMAbrange as cargas de trabalho de modelos de linguagem e fala listadas no relatório.
Impacto e implicações
O relatório argumenta que a competição em aceleradores de inferência generativa está migrando de simplesmente adicionar unidades de computação para abordar simultaneamente capacidade de dados, largura de banda, consumo de energia e latência de comunicação. O Raptor sacrifica alguma densidade de capacidade por unidade de área em troca de densidade de largura de banda muito superior à HBM e menor consumo de energia por unidade de largura de banda; se seus projetos de mapeamento de bancos, codificação de transmissão, atualização em alta temperatura, ECC e redundância tiverem o desempenho indicado pelos resultados iniciais de silício, essa combinação de capacidade moderada por placa e largura de banda extremamente alta poderá melhorar a decodificação de baixa latência e contexto longo e suportar a escalabilidade de modelos de trilhões de parâmetros em um rack de 72 placas.
Riscos
- O calor do acelerador deve se dissipar através da pilha DRAM sensível à temperatura, enquanto centenas de watts de energia devem ser fornecidos por TSVs, potencialmente criando restrições de temperatura de junção, queda de tensão e térmicas.
- Os 840 bancos e microbumps de 36 µm aumentam riscos de rendimento e alinhamento; mesmo uma taxa de falha de 1% poderia desativar um canal inteiro ou causar assimetria de canal.
- A 105°C, o tempo de retenção da DRAM cai de 32 ms para 4 ms e a frequência de atualização aumenta oito vezes; coordenação inadequada de erros leves, ECC, scrubbing e atualização poderia reduzir o throughput.
- Barramentos paralelos largos enfrentam problemas de crosstalk, ruído de comutação simultânea, distribuição de clock e skew entre pilhas.
- Sharding e comunicação coletiva entre aproximadamente 8.000 dispositivos virtuais impõem exigências rigorosas sobre topologia de rede, protocolos, largura de banda e baixa latência.
- A escalabilidade para múltiplas camadas empilhadas ainda enfrenta desafios de roteamento, entrega de energia e gerenciamento térmico, enquanto a trajetória de hybrid bonding também deve avançar para passos abaixo de 2 µm e empilhamento de oito camadas.
Pontos a observar
- Monitorar a validação da largura de banda efetiva de 100 TB/s, do consumo de energia e dos resultados de throughput do silício inicial em mais cargas de trabalho reais de inferência generativa.
- Monitorar se sharding, comunicação coletiva e latência de rede em implantações de 72 placas e múltiplos racks podem manter a eficiência de escalabilidade descrita no relatório.
- Monitorar a confiabilidade de longo prazo da atualização de 4 ms, ECC intercalado, scrubbing e 72 bancos sobressalentes em um ambiente de 105°C.
- Monitorar o roadmap de hybrid bonding para passos abaixo de 2 µm e empilhamento de oito camadas, bem como o progresso em roteamento, entrega de energia e gerenciamento térmico para pilhas multicamadas.