Interpretación de informes
Cobertura de los estudios más recientes de los principales bancos de inversión de Wall Street
Interpretación del informeHilo Research

Acelerador de inferencia generativa d-Matrix Raptor 3D-DRAM: Raptor utiliza 3D-DRAM para superar los cuellos de botella de ancho de banda de memoria y energía de la inferencia generativa

El informe presenta el silicio inicial de d-Matrix Raptor y su codiseño 3D-DRAM: 32 GB de capacidad y 100 TB/s de ancho de banda por tarjeta, con bloqueo de flujo, DBI sin pines y mecanismos de fiabilidad conscientes de la temperatura que abordan la sobrelectura, el consumo de energía de E/S y los problemas de actualización a alta temperatura.

Instituciónd-Matrix, Meta
Fecha20260823
EmpresaAcelerador de inferencia generativa d-Matrix Raptor 3D-DRAM
SectorAceleradores de inferencia de inteligencia artificial y semiconductores

Resumen

El informe presenta el silicio inicial de d-Matrix Raptor y su codiseño 3D-DRAM: 32 GB de capacidad y 100 TB/s de ancho de banda por tarjeta, con bloqueo de flujo, DBI sin pines y mecanismos de fiabilidad conscientes de la temperatura que abordan la sobrelectura, el consumo de energía de E/S y los problemas de actualización a alta temperatura.

No hay calificación de valores ni precio objetivo; el informe adopta una postura claramente positiva sobre la trayectoria tecnológica de Raptor.
Raptor3D-DRAMInferencia de IA generativaContexto largoAncho de banda de memoriaCodiseño de cómputo y memoriaSilicio inicial
  • Los pesos del modelo y la caché KV crecen simultáneamente; con 64 usuarios y una longitud de contexto de 1 millón por usuario, la caché KV es de aproximadamente 935 GB.
  • Una tarjeta Raptor consta de ocho chiplets, que proporcionan 32 GB de capacidad y 100 TB/s de ancho de banda; un rack de 72 tarjetas alcanza 2,3 TB y 7,2 PB/s.
  • El bloqueo de flujo reduce la sobrelectura del 33% causada por el mapeo de tres bancos a 0%, recuperando aproximadamente 33 TB/s de ancho de banda.
  • La inversión de flujo implementa DBI sin pines con una sobrecarga de metadatos del 0,8%, y el informe afirma que puede ahorrar el 20% de la energía de E/S.
  • El informe afirma que, en diversos modelos de lenguaje y voz, Raptor 3D-DRAM ofrece 4,71x y 2,44x el rendimiento de las soluciones basadas en HBM y SRAM, respectivamente.

Interpretación del informe

Visión general

Partiendo de la tensión entre capacidad, ancho de banda y consumo de energía en la inferencia generativa, el informe explica cómo d-Matrix Raptor apila directamente matrices lógicas sobre DRAM y diseña conjuntamente el mapeo de memoria, la transmisión de datos, la actualización térmica, la corrección de errores y los mecanismos de redundancia para utilizar 3D-DRAM en inferencia de baja latencia y contexto largo.

Perspectivas principales

La escala de datos en la inferencia generativa se está expandiendo simultáneamente en ambas direcciones: los pesos de los modelos continúan creciendo, mientras que la caché KV crece con la longitud del contexto y el número de usuarios simultáneos. El informe da el ejemplo de que, con 64 usuarios y una longitud de contexto de 1 millón por usuario, la caché KV es de aproximadamente 935 GB. La etapa de prellenado de la inferencia generalmente está limitada por el rendimiento de cómputo, mientras que la decodificación autorregresiva generalmente está limitada por el ancho de banda de memoria; en escenarios de baja latencia y lotes pequeños, la decodificación representa el tiempo de ejecución crítico. GQA alto y la decodificación especulativa pueden hacer que el cálculo de atención esté limitado por cómputo, pero MoE puede seguir limitado por el ancho de banda de memoria incluso con tamaños de lote moderados y decodificación especulativa, por lo que la capacidad y el ancho de banda deben escalar simultáneamente. El informe sostiene que los dos tipos de memoria existentes tienen claras deficiencias. La SRAM en chip ofrece latencia inferior al nanosegundo; un par de tarjetas de ejemplo puede proporcionar aproximadamente 300 TB/s de ancho de banda, 4 GB de capacidad, aproximadamente 1 ns de latencia y aproximadamente 0,5 pJ/bit de consumo de energía de E/S. Sin embargo, su celda de almacenamiento 6T tiene aproximadamente 10 veces el área de una celda DRAM 1T1C, el área de celda de bits desde los nodos N5 hasta N2 permanece en aproximadamente 0,021 µm², la fuga para capacidad a escala de gigabytes puede alcanzar decenas de vatios, la capacidad práctica es de aproximadamente 4 GB y el coste es aproximadamente 100 veces el de DRAM. HBM ofrece alta capacidad, pero está limitada por el espacio en el borde del encapsulado, el número de pilas, la velocidad de pines y el ancho de E/S; el informe estima que el techo práctico de ancho de banda de un sistema HBM4 es de aproximadamente 20 TB/s. Si HBM se llevara a 100 TB/s a 2,4 pJ/bit, la potencia de memoria por sí sola requeriría 1,92 kW, excluyendo la potencia de interconexión. El enfoque central de Raptor es apilar cara a cara lógica y DRAM, sustituyendo rutas de interposers de escala centimétrica por PHYs con conexiones verticales de escala milimétrica. El informe indica un consumo de energía de E/S vertical 3D de aproximadamente 0,3–0,4 pJ/bit, aproximadamente un orden de magnitud inferior al de HBM; la estimación específica de la interfaz es 0,37 pJ/bit, frente a aproximadamente 2–3 pJ/bit para HBM4. Raptor utiliza una capa superior lógica TSMC N4/N4P, una capa inferior 3D-DRAM y apilado cara a cara con un paso de 36 µm. Cada chiplet proporciona 4 GB de capacidad, 12,5 TB/s de ancho de banda y 840 microbancos DRAM; ocho chiplets forman una tarjeta de 32 GB y 100 TB/s, cuatro tarjetas forman un sistema de 128 GB y 400 TB/s, y 18 bandejas que suman 72 tarjetas alcanzan 2,3 TB de capacidad y 7,2 PB/s de ancho de banda. Las estimaciones de carga de modelos asumen pesos de 4 bits, caché KV de 8 bits y un dominio de escalado de 72 tarjetas. GLM 5.2 contiene 744 mil millones de parámetros totales y 40 mil millones de parámetros activos, y requiere 44,7 GB de caché KV por usuario con una longitud de contexto de 1 millón; Kimi K3 contiene 2,8 billones de parámetros totales y aproximadamente 102 mil millones de parámetros activos, y requiere 11,7 GB de caché KV por usuario. El informe afirma que 72 tarjetas Raptor, cada una con 32 GB, pueden alojar Kimi K3 con una longitud de contexto de 1 millón, y que la implementación desagregada y múltiples racks permiten un escalado adicional; su conclusión también afirma que un único rack Raptor que atienda un modelo de aproximadamente 3 billones de parámetros con una longitud de contexto de 1 millón puede ofrecer sostenidamente aproximadamente 1.000 TPS por usuario. Un ancho de banda elevado puede traducirse en rendimiento efectivo solo cuando cómputo, memoria e interconexión se codiseñan. Mediante fragmentación y comunicación colectiva, Raptor debe coordinar aproximadamente 8.000 dispositivos virtuales a través de una red jerárquica, frente a aproximadamente 72 dispositivos en un sistema GPU típico; por tanto, es necesaria una baja latencia para evitar las limitaciones impuestas por la ley de Amdahl. El informe adopta una topología de malla completa dentro del encapsulado, utilizando enlaces diagonales virtuales para reducir la latencia dentro del encapsulado mientras evita el aumento de distancia, consumo de energía D2D y número de capas del encapsulado asociados con diagonales físicas. Los protocolos intra-tarjeta e inter-tarjeta utilizan transferencias push unidireccionales iniciadas por el dispositivo que no requieren reconocimiento de la tarjeta de origen, y admiten múltiples transferencias paralelas de mensajes cortos. El primer desafío específico de integración es el mapeo de banco a canal. Cada acceso del motor de cómputo requiere 128 B de datos, mientras que cada acceso de columna de banco solo puede devolver 32 B, por lo que cada canal teóricamente requiere cuatro bancos. Un chiplet tiene 256 canales y la DRAM tiene 840 bancos; tras restar 72 bancos de repuesto, solo quedan 768 bancos utilizables, o tres por canal. Realizar directamente dos accesos lee 192 B para un único flit de 128 B, lo que provoca una sobrelectura del 33% y desperdicia aproximadamente 33 TB/s. Un esquema simple de escalonamiento de columnas requiere un búfer de desplazamiento de 192 B y aumenta la dificultad del cierre de temporización y la verificación. Raptor utiliza «bloqueo de flujo»: el cuarto acceso parcial de 32 B se comparte entre tres flits, de modo que 4×96 B de entrada forman exactamente 3×128 B de salida, reduciendo la sobrelectura a 0%, utilizando plenamente cada acceso de columna y recuperando aproximadamente 33 TB/s de ancho de banda. El segundo desafío es el consumo de energía de E/S. A 100 TB/s y 0,37 pJ/bit, la E/S por sí misma consume aproximadamente 296 W. La inversión de bus de datos HBM tradicional depende de ráfagas de varios ciclos, conocimiento anticipado de la ráfaga completa y pines DBI dedicados; la interfaz 3D-DRAM de Raptor utiliza transferencias de 256 bits de un solo ciclo sin ráfagas ni pines de banda lateral, por lo que este mecanismo no puede reutilizarse directamente. Su esquema de «inversión de flujo» compara flits adyacentes por canal: durante las escrituras, invierte el flit actual cuando la inversión da como resultado menos transiciones de bits y, durante las lecturas, restaura los datos utilizando una etiqueta de 1 bit almacenada junto con ECC. El informe afirma que el esquema incurre en solo un 0,8% de sobrecarga, no requiere modificaciones de PHY y puede reducir la energía de E/S en un 20%. El tercer desafío es la fiabilidad a una temperatura de unión de 105°C. El tiempo de retención estándar de DRAM es de 32 ms a 85°C, pero cae a 4 ms a 105°C, lo que implica un aumento de ocho veces en la frecuencia de actualización; las altas temperaturas también aumentan los errores blandos, mientras que los riesgos de rendimiento derivados de 840 bancos, la asimetría de canal causada por un solo banco fallido y la contención entre ECC, scrubbing y actualización por el rendimiento deben abordarse simultáneamente. Raptor aprovecha su estructura de bancos profundos, que tiene entre 16 y 32 veces menos filas, por lo que el coste de ancho de banda de la actualización de 4 ms es solo del 1,37%, lo que le permite sostener aproximadamente 100 TB/s; las ocho ubicaciones finales de columna almacenan códigos de corrección de errores Reed–Solomon [132,128] entrelazados y bits DBI. Setenta y dos microbancos redundantes en línea utilizan una cadena de bancos de dos niveles para manejar hasta dos fallos en ubicaciones arbitrarias, con bancos de repuesto que los sustituyen, preservando así el ancho simétrico del canal mientras añaden un coste de enrutamiento insignificante. En una comparación basada en área de silicio y ancho de banda efectivo, la densidad de capacidad de Raptor es de 11,4 MB/mm², por debajo de 21,9 para HBM4 24 Gb, 26,3 para HBM4 32 Gb y 21,9 MB/mm² para Rubin R200; sin embargo, su densidad de ancho de banda es de 32,6 GB/s/mm², significativamente por encima de los respectivos 1,67, 1,51 y 1,39 GB/s/mm². El consumo de energía de Raptor por GB/s es 2,96 mW, frente a 40,0 mW para todos los objetivos de comparación; esta comparación asume una utilización efectiva del ancho de banda del 83% para Raptor y del 85% para Rubin. Por tanto, el informe enfatiza que la inferencia de baja latencia no requiere necesariamente la máxima capacidad por tarjeta, sino que se adapta mejor a una capacidad moderada combinada con un ancho de banda extremadamente alto. Los materiales de silicio inicial también indican que, en modelos que incluyen Llama-3.1 70B, DeepSeek-V3, Kimi K2, GPT-OS, Whisper y Canary, Raptor 3D-DRAM ofrece 4,71x el rendimiento de las soluciones basadas en HBM y 2,44x el de las soluciones basadas en SRAM, siendo además menos sensible a la latencia y al ancho de banda de red.

Marco de análisis

El informe primero descompone los cuellos de botella de la inferencia generativa en las etapas de prellenado y decodificación, luego compara SRAM, HBM y 3D-DRAM en términos de capacidad, ancho de banda, latencia, consumo de energía de E/S y restricciones de encapsulado. Posteriormente estima la capacidad y el ancho de banda del modelo desde el nivel de chiplet hasta tarjetas, bandejas y un rack de 72 tarjetas, analizando uno por uno el mapeo de bancos, el consumo de energía de E/S, la actualización a alta temperatura, ECC y los problemas de redundancia. Por último, valida las compensaciones de diseño mediante la comparación de utilización efectiva del ancho de banda, métricas por unidad de área de silicio, consumo de energía por unidad de ancho de banda y rendimiento de múltiples modelos.

Notas metodológicas

  • Marco de análisis de industria/sectorMarco de oferta y demanda

    Correspondencia entre requisitos de datos de inferencia y capacidades de memoria

    El informe considera los crecientes pesos de los modelos y la caché KV como demanda de capacidad y ancho de banda, y luego compara esta demanda con la capacidad, el ancho de banda y el consumo de energía que pueden proporcionar SRAM, HBM y 3D-DRAM para determinar qué arquitectura de memoria es más adecuada para la inferencia de contexto largo.

  • (Método fuera de vocabulario)Otro

    Descomposición de cuellos de botella de prellenado–decodificación

    El informe divide el proceso de inferencia en una etapa de prellenado, generalmente limitada por el rendimiento de cómputo, y una etapa de decodificación, generalmente limitada por el ancho de banda de memoria, para explicar qué parte del tiempo de ejecución aborda principalmente la 3D-DRAM de alto ancho de banda.

  • (Método fuera de vocabulario)Otro

    Codiseño de hardware, arquitectura y carga de trabajo

    En lugar de tratar la 3D-DRAM como almacenamiento externo, el informe diseña conjuntamente el mapeo de bancos, el flujo de datos, los protocolos de interconexión, la actualización, la corrección de errores y la redundancia para que el ancho de banda bruto proporcionado por el apilado físico pueda traducirse en rendimiento efectivo de inferencia.

  • (Método fuera de vocabulario)Otro

    Comparación normalizada de área de silicio y ancho de banda efectivo

    El informe compara Raptor, HBM4 y Rubin R200 por capacidad por milímetro cuadrado, ancho de banda por milímetro cuadrado y consumo de energía por GB/s, incorporando una utilización efectiva del ancho de banda del 83% para Raptor y del 85% para Rubin para evitar comparar únicamente especificaciones nominales.

  • (Método fuera de vocabulario)Otro

    Ley de Amdahl

    El informe utiliza esta ley para explicar que incluso si el ancho de banda de memoria aumenta sustancialmente, los componentes seriales o de comunicación restantes seguirán limitando la aceleración global del sistema si la latencia de comunicación intra-tarjeta o inter-tarjeta no disminuye en consecuencia.

Correspondencia y comparación de activos

Correspondencia estructurada entre la tesis y activos concretos (fortalezas, debilidades, pares y riesgos).

  • Acelerador de inferencia generativa d-Matrix Raptor 3D-DRAM
    El informe lo posiciona como una plataforma integrada de lógica y memoria apilada en 3D para inferencia generativa de contexto largo y baja latencia.
    Fortalezas
    100 TB/s de ancho de banda por tarjeta, bajo consumo de energía de E/S, escalabilidad desde chiplets hasta un rack de 72 tarjetas y funciones codiseñadas que incluyen bloqueo de flujo, inversión de flujo, actualización consciente de la temperatura, ECC y cadenas de bancos.
    Debilidades
    La capacidad por tarjeta es de 32 GB y la densidad de capacidad por área de silicio es de 11,4 MB/mm², inferior a las cifras de HBM4 y Rubin R200 presentadas en el informe; el sistema también debe coordinar aproximadamente 8.000 dispositivos virtuales.
    Comparación
    El informe asigna a Raptor una densidad de ancho de banda de 32,6 GB/s/mm² y un consumo de energía por unidad de ancho de banda de 2,96 mW/GB/s, frente a 1,39–1,67 GB/s/mm² y 40,0 mW/GB/s, respectivamente, para los objetivos de comparación; el rendimiento entre modelos es 4,71x y 2,44x superior al de las soluciones basadas en HBM y SRAM, respectivamente.
    Riesgos
    Los riesgos de integración incluyen gestión térmica y suministro de energía para el apilado 3D, rendimiento de microbumps, fallos de bancos, actualización y errores blandos a 105°C, integridad de señal en buses paralelos anchos y latencia de comunicación entre múltiples chiplets y tarjetas.

Datos clave

  • Caché KV para 64 usuarios con una longitud de contexto de 1 millónAproximadamente 935 GBIlustra cómo el contexto largo y los usuarios simultáneos amplifican conjuntamente los requisitos de capacidad de memoria.
  • Especificaciones de ejemplo de SRAM300 TB/s, 4 GB, aproximadamente 1 ns, aproximadamente 0,5 pJ/bitAncho de banda y latencia excepcionales, pero la capacidad, las fugas y el coste limitan el escalado.
  • Techo práctico de ancho de banda HBM4Aproximadamente 20 TB/sLimitado por el espacio en el borde del encapsulado, el número de pilas y el escalado de E/S.
  • Potencia de memoria HBM a 100 TB/s1,92 kWCalculada a 2,4 pJ/bit y excluyendo la potencia de interconexión.
  • Tarjeta individual Raptor32 GB, 100 TB/sConsta de ocho chiplets 3D-DRAM, cada uno de los cuales proporciona 4 GB y 12,5 TB/s.
  • Rack Raptor de 72 tarjetas2,3 TB, 7,2 PB/sConsta de 18 bandejas y 72 tarjetas.
  • Estimación del modelo GLM 5.2744B parámetros totales, 40B parámetros activos, 44,7 GB KV/usuarioAsume una longitud de contexto de 1 millón.
  • Estimación del modelo Kimi K32,8T parámetros totales, aproximadamente 102B parámetros activos, 11,7 GB KV/usuarioSetenta y dos tarjetas de 32 GB pueden alojar el modelo con una longitud de contexto de 1 millón.
  • Sobrelectura original de mapeo de bancos33%, aproximadamente 33 TB/sCon solo tres bancos por canal, leer directamente un flit de 128 B requiere obtener 192 B.
  • Efecto del bloqueo de flujo0% de sobrelecturaTras compartir accesos parciales, 384 B de entrada corresponden a 384 B de salida efectiva.
  • Potencia de E/S 3D-DRAM a 100 TB/s296 WCalculada a 0,37 pJ/bit.
  • Efecto de la inversión de flujo20% de ahorro de energía, 0,8% de sobrecargaLa etiqueta se almacena junto con ECC, sin requerir pines adicionales de banda lateral PHY.
  • Requisito de actualización a 105°C32 ms reducidos a 4 ms, con una frecuencia de actualización ocho veces mayorEl diseño de bancos profundos limita el coste de ancho de banda al 1,37%.
  • Densidad de ancho de bandaRaptor 32,6 GB/s/mm²; HBM4 y Rubin R200 con 1,67, 1,51 y 1,39 GB/s/mm²Comparado sobre una base de ancho de banda efectivo.
  • Consumo de energía por unidad de ancho de bandaRaptor 2,96 mW/GB/s; objetivos de comparación 40,0 mW/GB/sCuanto menor, mejor.
  • Comparación de rendimiento entre modelos4,71x superior a HBM y 2,44x superior a SRAMCubre las cargas de trabajo de modelos de lenguaje y voz enumeradas en el informe.

Impacto e implicaciones

El informe sostiene que la competencia en aceleradores de inferencia generativa está pasando de simplemente añadir unidades de cómputo a abordar simultáneamente la capacidad de datos, el ancho de banda, el consumo de energía y la latencia de comunicación. Raptor sacrifica cierta densidad de capacidad por unidad de área a cambio de una densidad de ancho de banda muy superior a HBM y un menor consumo de energía por unidad de ancho de banda; si sus diseños de mapeo de bancos, codificación de transmisión, actualización a alta temperatura, ECC y redundancia funcionan como indican los resultados de silicio inicial, esta combinación de capacidad moderada por tarjeta y ancho de banda extremadamente alto podría mejorar la decodificación de contexto largo y baja latencia, y respaldar el escalado de modelos de billones de parámetros a un rack de 72 tarjetas.

Riesgos

  • El calor del acelerador debe disiparse a través de la pila DRAM sensible a la temperatura, mientras que cientos de vatios de potencia deben suministrarse a través de TSVs, lo que potencialmente crea restricciones de temperatura de unión, caída de tensión y térmicas.
  • Los 840 bancos y microbumps de 36 µm aumentan los riesgos de rendimiento y alineación; incluso una tasa de fallos del 1% podría desactivar un canal completo o causar asimetría de canales.
  • A 105°C, el tiempo de retención de DRAM cae de 32 ms a 4 ms y la frecuencia de actualización aumenta ocho veces; una mala coordinación de errores blandos, ECC, scrubbing y actualización podría reducir el rendimiento.
  • Los buses paralelos anchos afrontan problemas de diafonía, ruido de conmutación simultánea, distribución de reloj y desajuste entre pilas.
  • La fragmentación y comunicación colectiva entre aproximadamente 8.000 dispositivos virtuales imponen exigentes requisitos sobre topología de red, protocolos, ancho de banda y baja latencia.
  • El escalado a múltiples capas apiladas todavía afronta desafíos de enrutamiento, suministro de energía y gestión térmica, mientras que la ruta de unión híbrida también debe avanzar hacia pasos inferiores a 2 µm y apilado de ocho capas.

Aspectos que vigilar

  • Supervisar la validación del ancho de banda efectivo de 100 TB/s, el consumo de energía y los resultados de rendimiento del silicio inicial en más cargas de trabajo reales de inferencia generativa.
  • Supervisar si la fragmentación, la comunicación colectiva y la latencia de red en implementaciones de 72 tarjetas y múltiples racks pueden mantener la eficiencia de escalado descrita en el informe.
  • Supervisar la fiabilidad a largo plazo de la actualización de 4 ms, ECC entrelazado, scrubbing y 72 bancos de repuesto en un entorno de 105°C.
  • Supervisar la hoja de ruta de unión híbrida hacia pasos inferiores a 2 µm y apilado de ocho capas, así como el progreso en enrutamiento, suministro de energía y gestión térmica para pilas multicapa.

Configuración

Inicia sesión para ver los accesos recientes