Interpretación de informes
Cobertura de los estudios más recientes de los principales bancos de inversión de Wall Street
Interpretación del informeHilo Research

Vertical-Die (V-die) 3.5D Integration for Ultrahigh-Bandwidth Memory Systems: La arquitectura V-die 3.5D supera los cuellos de botella de E/S, capacidad y refrigeración de la HBM convencional mediante interconexiones laterales y refrigeración directa

El informe propone una arquitectura V-die de matrices verticales y valida su viabilidad mediante modelos que abarcan escalas electromagnéticas, de sistema y térmicas. Los resultados muestran un aumento de 4.01 veces en el ancho de banda, una mejora del 81.2% en la velocidad de decodificación de LLM, una mejora de 2.2 veces en la estabilidad del rendimiento bajo escalado del contexto y una reducción del 43.7% en la temperatura máxima frente a HBM4 de 16-Hi.

Fecha20260803
SectorSemiconductor Memory and Advanced Packaging

Resumen

El informe propone una arquitectura V-die de matrices verticales y valida su viabilidad mediante modelos que abarcan escalas electromagnéticas, de sistema y térmicas. Los resultados muestran un aumento de 4.01 veces en el ancho de banda, una mejora del 81.2% en la velocidad de decodificación de LLM, una mejora de 2.2 veces en la estabilidad del rendimiento bajo escalado del contexto y una reducción del 43.7% en la temperatura máxima frente a HBM4 de 16-Hi.

—
Memoria de alto ancho de bandaV-dieIntegración 3.5DEmpaquetado avanzadoInteligencia artificialMuro de memoriaRefrigeración líquida directaSistemas chiplet
  • V-die posiciona verticalmente las matrices DRAM y las conecta a los bumps inferiores a través de las paredes laterales, reduciendo la dependencia del número de vías a través de silicio.
  • La comparación de configuraciones muestra que el número de pines aumenta de 2048 a 8192, mientras que el ancho de banda teórico de memoria sube de 10.24 TB/s a 40.96 TB/s.
  • Aunque el enrutamiento RDL de 9 mm es más largo que el enrutamiento de 5 mm de HBM, aún cumple el estándar de máscara de ojo del receptor JEDEC HBM4 a 8 Gbps.
  • La simulación de LLM se resume como una mejora del 81.2% en la velocidad de decodificación y una mejora de 2.2 veces en la estabilidad del rendimiento a medida que escala la longitud de contexto.
  • La DRAM V-die sin TSV puede ahorrar un 25% en consumo de energía y recuperar área de matriz.
  • El refrigerante fluye directamente a través de los espacios entre matrices, reduciendo la temperatura máxima en un 43.7% frente a HBM4 de 16-Hi.

Interpretación del informe

Visión general

Este es un estudio de arquitectura de semiconductores que aborda el problema del muro de memoria de la IA. El informe sostiene que la trayectoria convencional de escalado de HBM basada en la tasa de datos por canal, la altura de pila y el ancho de E/S está cada vez más limitada por el área de TSV, la altura del encapsulado y la acumulación de calor. La integración 3.5D V-die propuesta proporciona mayor escalabilidad de E/S y térmica mediante E/S en paredes laterales, bumps inferiores y refrigeración directa entre matrices.

Perspectivas principales

El informe atribuye primero el problema al desajuste entre el crecimiento del tamaño de los modelos de IA y la tasa de expansión de la capacidad de memoria por GPU: se describe que el número de parámetros de los modelos Transformer avanzados aumenta 410 veces cada dos años, mientras que la memoria por GPU aumenta solo dos veces. Históricamente, HBM ha escalado principalmente en tres dimensiones: tasa de datos por canal, altura de pila y ancho de E/S. La trayectoria generacional presentada en el informe abarca HBM1 (2014), HBM2 (2018), HBM2E (2020), HBM3 (2022), HBM3E (2024) y HBM4 (2026), con pilas que progresan de 4-Hi hacia 12-Hi/16-Hi, tasas por canal que suben de 1 Gbps a 8 Gbps y conteos de E/S que aumentan de 1024 a 2048. Sin embargo, este enfoque de escalado está cada vez más sujeto a restricciones físicas. La primera restricción es que los TSV ocupan área utilizable de DRAM, lo que impide que su número aumente indefinidamente. La segunda es la altura del encapsulado a lo largo del eje Z: la tabla indica alturas totales típicas de aproximadamente 720, 720 y 775 micrómetros para HBM1/HBM2, HBM3 y HBM4, respectivamente, mientras que los espesores típicos por capa para configuraciones 8-Hi, 12-Hi y 16-Hi son aproximadamente 90, 60 y 48.4 micrómetros. Añadir más capas bajo una restricción de altura fija requiere matrices más delgadas, lo que puede afectar el rendimiento de fabricación y aumentar la densidad térmica. La tercera restricción es la trayectoria térmica vertical: el calor de las matrices inferiores debe atravesar múltiples capas de BEOL, microbumps, material de relleno y posibles microvacíos. La resistencia térmica se acumula capa por capa, creando un pronunciado gradiente de temperatura y un cuello de botella de refrigeración. El diseño V-die dispone las matrices DRAM verticalmente e implementa interconexiones mediante pads de E/S en las paredes laterales y bumps inferiores. Esta estructura ya no deja que el escalado de E/S esté completamente limitado por los TSV dentro de la matriz, mientras que los espacios entre matrices aumentan la superficie accesible al refrigerante. En una configuración de 16-Hi, el informe sostiene que este diseño ofrece una mayor escalabilidad de E/S, pero la contrapartida es que el RDL debe extenderse a cada matriz. La trayectoria de enrutamiento más larga es de aproximadamente 9 mm, frente a aproximadamente 5 mm para HBM convencional, por lo que es necesario verificar si la pérdida de inserción adicional, las reflexiones y la diafonía siguen siendo aceptables. La validación eléctrica calibra simulaciones electromagnéticas utilizando mediciones de parámetros S de una guía de onda coplanar adaptada de 40 GHz y 50 ohmios. La permitividad relativa extraída es 6.5, la tangente de pérdida es 0.002 y la conductividad del cobre es 3×10^7 S/m. El RDL se modela como trazas de señal de cobre embebidas en dióxido de silicio entre planos de tierra superior e inferior. Los resultados muestran que, a la tasa máxima de 8 Gbps, las características del canal pasivo de V-die son generalmente comparables a las de HBM. Las trazas más largas aumentan la pérdida de inserción, pero la pérdida de retorno se mantiene similar, mientras que la diafonía de extremo cercano y de extremo lejano permanece por debajo de −30 dB en todo el rango de frecuencias. A 8 Gbps, el canal V-die satisface los requisitos de máscara de ojo del receptor JEDEC HBM4 de 0.3 UI y 100 mV, aunque su margen de ojo es ligeramente inferior al de HBM. El análisis a nivel de sistema incorpora los parámetros validados electromagnéticamente en un modelo de memoria basado en temporización JEDEC y utiliza gem5 para la simulación de tráfico sintético. Ambas configuraciones comparativas emplean 16 pilas de memoria y una tasa de pines de 8.0 Gbps. La tabla de configuración muestra que el número de pines por pila aumenta de 2048 a 8192, el ancho de banda de memoria sube de 10.24 TB/s a 40.96 TB/s y el ancho de banda de la caché L2 aumenta correspondientemente de 24.0 TB/s a 96.0 TB/s para evitar que la parte de caché enmascare la capacidad de E/S de memoria. Con base en estos resultados, el informe concluye finalmente que V-die puede proporcionar un ancho de banda 4.01 veces superior. A nivel de aplicación, se utiliza LLMCompass para evaluar el modelo A100 y un modelo H100 construido recientemente para este estudio. La carga de trabajo es un modelo de 175 mil millones de parámetros con 96 capas, 96 cabezas de atención y una dimensión oculta de 12288. El informe mide el rendimiento de decodificación de inferencia mediante la tasa de generación de tokens y la latencia a nivel de operación, y concluye que V-die ofrece una mejora del 81.2% en la velocidad de decodificación. En la prueba de escalado de contexto, la página de resultados indica una reducción de velocidad del 24.8%, mientras que el informe concluye que V-die proporciona una estabilidad del rendimiento 2.2 veces mayor que el diseño de referencia, demostrando que un ancho de banda de memoria superior y más estable puede aliviar los cuellos de botella de memoria en la inferencia de contexto largo. El análisis de potencia y térmico explica además las ventajas de escalado de V-die. La matriz base HBM4 consume 9 W, compuestos por 6 W para el PHY y 3 W para los TSV. Cada matriz DRAM HBM4 consume aproximadamente 2 W, incluida la sobrecarga de TSV. La DRAM V-die elimina los TSV, lo que, según el informe, puede ahorrar un 25% en consumo de energía al tiempo que libera área de matriz. La HBM4 convencional depende de una placa fría superior, lo que requiere que el calor atraviese toda la pila. V-die, en cambio, permite que el refrigerante fluya directamente por los espacios entre matrices, posibilitando que el calor generado por cada matriz se absorba localmente; el refrigerante entre matrices actúa efectivamente como un plano de tierra térmico. Bajo condiciones idénticas con una temperatura ambiente de 45°C, la temperatura máxima de V-die es inferior a la de HBM4, eliminando el pronunciado gradiente de temperatura entre matrices. El resultado final es una reducción del 43.7% en la temperatura máxima frente a HBM4 de 16-Hi. Por lo tanto, el informe concluye que V-die mitiga simultáneamente las restricciones de escalado de E/S, capacidad y térmicas mediante enrutamiento vertical y refrigeración directa, y que el modelado conjunto a través de escalas electromagnéticas, de sistema, de aplicación y térmicas es fundamental para determinar si la arquitectura puede traducirse en un mejor rendimiento de LLM. El estudio también enfatiza que la simulación de sistemas en la era de chiplets e integración heterogénea debe incorporar restricciones físicas entre dominios, en lugar de inferir el rendimiento de la aplicación únicamente a partir del ancho de banda nominal.

Marco de análisis

El estudio sigue la secuencia de definición del problema, diseño de arquitectura, validación física, simulación de sistema, pruebas de aplicación y validación térmica. Primero utiliza especificaciones generacionales de HBM para explicar las restricciones impuestas por los TSV, la altura del encapsulado y las trayectorias térmicas, y después propone un diseño V-die con interconexiones laterales y refrigeración entre matrices. Posteriormente evalúa la integridad de señal RDL con un modelo electromagnético calibrado por mediciones, incorpora los parámetros validados en un modelo de tráfico sintético gem5 y un modelo de carga de trabajo LLMCompass, y finalmente compara el rendimiento térmico de HBM4 y V-die utilizando mapas de potencia y redes de resistencia térmica.

Notas metodológicas

  • OtroOtro

    Marco de validación conjunta entre escalas

    El informe propaga progresivamente las restricciones electromagnéticas y térmicas de la capa física hacia modelos de sistema y aplicaciones LLM para determinar si los cambios arquitectónicos pueden producir mejoras reales en ancho de banda, latencia y rendimiento de decodificación.

  • OtroOtro

    Simulación electromagnética calibrada mediante mediciones de parámetros S

    El estudio utiliza mediciones de guía de onda coplanar de 40 GHz y 50 ohmios para extraer permitividad, pérdidas y conductividad del cobre, y después emplea estos parámetros para simular la pérdida de inserción, las reflexiones, la diafonía y los diagramas de ojo de las trazas RDL más largas.

  • OtroOtro

    Simulación de tráfico sintético y carga de trabajo LLM

    El estudio utiliza primero gem5 y un modelo de temporización JEDEC para probar el ancho de banda y la latencia bajo cargas de tráfico, y después usa LLMCompass para evaluar la tasa de generación de tokens y la latencia a nivel de operación de un modelo de 175 mil millones de parámetros.

  • OtroOtro

    Análisis de red de resistencia térmica

    El informe compara las trayectorias de conducción térmica de una placa fría superior y la refrigeración directa entre matrices, analizando la resistencia térmica total, la temperatura máxima y los gradientes de temperatura a través de distintas capas de matrices.

Datos clave

  • Crecimiento de parámetros del modelo frente al escalado de memoria GPU410-fold every two years; 2-fold for memory per GPUUtilizado por el informe para ilustrar el desajuste de crecimiento subyacente al muro de memoria de los sistemas de IA
  • Rango generacional de HBMHBM1 (2014) to HBM4 (2026)Las pilas escalan de 4-Hi a 12-Hi/16-Hi, mientras que las tasas por canal suben de 1 Gbps a 8 Gbps
  • Espesor típico de matriz por capa90 micrometers, 60 micrometers, 48.4 micrometersCorresponde a configuraciones 8-Hi, 12-Hi y 16-Hi, respectivamente, e ilustra la presión para adelgazar las matrices bajo una restricción de altura fija del encapsulado
  • Longitud de trayectoria RDLV-die 9 mm, HBM 5 mmEl enrutamiento más largo de V-die aumenta la pérdida de inserción, pero la pérdida de retorno sigue siendo similar
  • Calibración del modelo electromagnético40 GHz, 50 ohmsLos parámetros de material se extraen correlacionando mediciones de parámetros S de guía de onda coplanar con simulaciones
  • Parámetros de material extraídosεr=6.5, tanδ=0.002, copper conductivity=3×10^7 S/mUtilizados para simulación de alta fidelidad del enrutamiento RDL
  • Nivel de diafoníaBoth NEXT and FEXT below −30 dBEn todo el rango de frecuencias analizado
  • Cumplimiento del diagrama de ojo8 Gbps; 0.3 UI, 100 mVV-die cumple la máscara de ojo del receptor JEDEC HBM4, pero su margen es ligeramente inferior al de HBM
  • Pines por pilaIncreased from 2048 to 8192Configuración de comparación para HBM4 y V-die
  • Ancho de banda de memoriaIncreased from 10.24 TB/s to 40.96 TB/sValores de configuración; el informe concluye que el ancho de banda real mejora 4.01 veces
  • Ancho de banda de caché L2Increased from 24.0 TB/s to 96.0 TB/sElevado para evitar que la parte de caché enmascare la capacidad de E/S de memoria
  • Carga de trabajo LLM175 billion parameters, 96 layers, 96 attention heads, hidden dimension of 12288Utilizada para simular la tasa de generación de tokens y la latencia a nivel de operación
  • Rendimiento de decodificación LLM81.2% fasterEl resumen del informe sobre el rendimiento relativo de V-die
  • Estabilidad de escalado de contexto2.2 timesLa mejora resumida por el informe en la estabilidad del rendimiento; la página de resultados también indica una reducción de velocidad del 24.8%
  • Consumo de potencia de la matriz base HBM49 W6 W para el PHY y 3 W para los TSV
  • Consumo de potencia DRAM HBM4 por matrizApproximately 2 WIncluye la sobrecarga de TSV
  • Ahorro de energía de DRAM V-die25%Derivado de la eliminación de TSV, al tiempo que se recupera área de matriz
  • Mejora de temperatura máximaReduced by 43.7%Frente a HBM4 de 16-Hi bajo la misma temperatura ambiente de 45°C

Impacto e implicaciones

El informe sostiene que, si la E/S lateral y la refrigeración directa entre matrices pueden implementarse según lo validado, V-die podría eludir la trayectoria convencional de escalado de HBM que depende de más TSV y matrices más delgadas, permitiendo mayor capacidad y E/S más amplia sin incrementos equivalentes de área, consumo de energía y densidad térmica. Para los sistemas de IA, estas mejoras podrían traducirse en un mayor rendimiento de decodificación de LLM y una mayor estabilidad de rendimiento para cargas de trabajo de contexto largo. El estudio también demuestra que las arquitecturas chiplet novedosas deben validarse utilizando modelos conjuntos que abarquen capas electromagnéticas, térmicas y de aplicación.

Riesgos

  • V-die debe utilizar conexiones RDL de hasta aproximadamente 9 mm de longitud para conectar matrices en cada capa. Frente a las trayectorias de aproximadamente 5 mm de HBM, esto genera mayor pérdida de inserción y un margen de diagrama de ojo ligeramente reducido.
  • La arquitectura implica restricciones estrechamente acopladas de electricidad, temporización, capacidad y térmica. El informe declara explícitamente que es necesaria una evaluación entre dominios y que el rendimiento nominal en una única capa es insuficiente para demostrar la viabilidad del sistema.

Aspectos que vigilar

  • Mayor progreso tecnológico en interconexiones, fabricación y estructuras de refrigeración a lo largo de la hoja de ruta de empaquetado V-die.
  • Si el marco de validación entre escalas puede extenderse a sistemas de integración heterogénea basados en chiplets y módulos reutilizables de cargas de trabajo LLM.

Configuración

Inicia sesión para ver los accesos recientes