Interpretación de informes
Cobertura de los estudios más recientes de los principales bancos de inversión de Wall Street
Interpretación del informeHilo Research

Memoria de semiconductores y empaquetado avanzado: HBM eleva el límite de ancho de banda de memoria para los sistemas de IA, mientras que el empaquetado avanzado, la gestión térmica y la fiabilidad se vuelven críticos para la siguiente etapa de escalado

Micron considera que el escalado continuo de los modelos de IA está convirtiendo el ancho de banda de memoria en un cuello de botella del rendimiento del sistema. HBM reduce significativamente la brecha entre computación y memoria mediante alto paralelismo, interfaces amplias y apilamiento 3D. HBM4 incrementa aún más el ancho de banda y la capacidad, pero también introduce mayores desafíos de consumo de silicio, complejidad de empaquetado, gestión térmica y fiabilidad.

InstituciónMicron
EmpresaArquitecturas de memoria en evolución para la IA (HBM)
SectorMemoria de semiconductores y empaquetado avanzado

Resumen

Micron considera que el escalado continuo de los modelos de IA está convirtiendo el ancho de banda de memoria en un cuello de botella del rendimiento del sistema. HBM reduce significativamente la brecha entre computación y memoria mediante alto paralelismo, interfaces amplias y apilamiento 3D. HBM4 incrementa aún más el ancho de banda y la capacidad, pero también introduce mayores desafíos de consumo de silicio, complejidad de empaquetado, gestión térmica y fiabilidad.

—
HBMComputación acelerada por IAMuro de memoriaDRAMEmpaquetado avanzadoSistema en paqueteGestión térmicaFiabilidadInterconexiones de alta velocidad
  • El modelo Roofline muestra que HBM eleva el límite de ancho de banda de memoria, permitiendo que las cargas de trabajo de IA intensivas en memoria alcancen un mayor rendimiento antes de llegar al cuello de botella.
  • En los sistemas de ejemplo, ocho pilas HBM3 proporcionan 5.3 TB/s de ancho de banda teórico, frente a 307 GB/s de un sistema DDR5 de ocho canales.
  • HBM4 tiene un ancho de banda nominal de 2800 GB/s, con el número de canales aumentando a 32 y las E/S de datos aumentando a 2048.
  • Ofrecer capacidad HBM3E consume aproximadamente tres veces más silicio que DDR5, lo que refleja el coste combinado del diseño, el empaquetado y la complejidad de fabricación.
  • En el récord de preentrenamiento de Llama 3 405B de 54 días, aproximadamente el 78% de las interrupciones inesperadas se atribuyeron a problemas de hardware confirmados o presuntos.
  • Mayores velocidades D2D, pilas más altas, refrigeración líquida, unión híbrida e interposers más grandes son direcciones tecnológicas importantes para el escalado posterior.

Interpretación del informe

Visión general

Este es un informe técnico sobre arquitectura de memoria para IA publicado por Micron. Se centra en explicar por qué la memoria se ha convertido en una restricción central para los modelos grandes y la computación acelerada, y cómo HBM mitiga el «muro de memoria» mediante alto ancho de banda, alto paralelismo e integración heterogénea. El informe también revisa la evolución de HBM1 a HBM4 y analiza los retos futuros relacionados con interconexiones de alta velocidad, empaquetado avanzado, gestión térmica y fiabilidad.

Perspectivas principales

El informe comienza con las leyes de escalado de los modelos grandes: el rendimiento de los modelos de lenguaje mejora de forma continua a medida que aumentan el tamaño del modelo, el tamaño del conjunto de datos y el cómputo de entrenamiento, pero los tres deben escalarse de forma simultánea, y un cuello de botella en cualquiera de los factores limitará las ganancias generales. A medida que el rendimiento de cómputo de las GPU sigue aumentando, el «muro de memoria», causado porque los datos no llegan a los procesadores con suficiente rapidez, se vuelve cada vez más destacado. Por lo tanto, la memoria ha evolucionado de ser un componente auxiliar a convertirse en un factor central que determina si el rendimiento de los sistemas de IA puede continuar escalando. El informe utiliza el modelo Roofline para explicar esta restricción. El modelo mide el rendimiento alcanzable en operaciones por segundo y la intensidad aritmética en operaciones por byte. Las aplicaciones con baja intensidad aritmética operan en la región limitada por memoria, donde el rendimiento viene determinado por el ancho de banda de memoria, mientras que las aplicaciones con alta intensidad aritmética tienen más probabilidades de estar limitadas por la capacidad de cómputo. HBM eleva el límite de ancho de banda de memoria, lo que permite que las cargas de trabajo de IA intensivas en memoria alcancen un mayor rendimiento antes de llegar al límite de ancho de banda y actúa así como un «puente entre cómputo y memoria» entre la capacidad de cómputo y la capacidad de entrega de datos. HBM logra alto paralelismo mediante múltiples canales independientes, E/S amplias, conexiones punto a punto de corta distancia y apilamiento 3D. Cada dado DRAM contiene múltiples canales independientes, y cada canal dispone de dos pseudocanales que comparten los buses de comando y dirección, pero utilizan buses de datos independientes. El dado base gestiona las interfaces de comando y datos entre el host y la DRAM, el PHY de microbump conecta el host con el dado base y el PHY TSV 3D conecta la pila DRAM con el dado base. HBM3E tiene 128 bancos por dado, que aumentan a 256 en HBM4. Las conexiones de interposer de alta densidad aumentan de aproximadamente 1K E/S en HBM3E a aproximadamente 2K E/S en HBM4. Las especificaciones generacionales muestran que HBM sigue evolucionando en ancho de banda, número de canales y capacidad. Los hitos respectivos para HBM1, HBM2, HBM2E, HBM3, HBM3E y HBM4 son 2014, 2018, 2020, 2022, 2024 y 2026. Sus recuentos de canales son 8, 8, 8, 16, 16 y 32, respectivamente; los recuentos de pseudocanales son ninguno, 16, 16, 32, 32 y 64; y los anchos de pseudocanal son 128, 64, 64, 32, 32 y 32 bits. La longitud de ráfaga aumentó de 2 en HBM1 a 4 en HBM2 y HBM2E, y posteriormente a 8 desde HBM3 en adelante. El ancho de prefetch es de 256 bits en todas las generaciones. El número de E/S de datos permaneció en 1024 desde HBM1 hasta HBM3E y aumentó a 2048 en HBM4. Las tasas de datos nominales correspondientes desde HBM1 hasta HBM4 son 1, 2.4, 3.6, 6.4, 8 y 11 Gbps, mientras que los anchos de banda nominales son 128, 307, 460, 819, 1024 y 2800 GB/s. Las densidades DRAM son 2, 8, 16, 16, 24 y 24 Gb, respectivamente. La altura de las pilas evolucionó de cuatro capas en HBM1 a cuatro/ocho capas en HBM2 y HBM2E, ocho/12 capas en HBM3, y ocho o más capas en HBM3E y HBM4. En consecuencia, la capacidad por pila aumentó de 1 GB a 4/8 GB, 8/16 GB y 16/24 GB, alcanzando 24 GB o más en HBM3E y HBM4. Cada generación aumenta simultáneamente la tasa de datos, el número de pseudocanales, la densidad y la altura de pila para mejorar, respectivamente, el ancho de banda, la granularidad de acceso, la eficiencia y la capacidad. La comparación a nivel de sistema ilustra además la ventaja de ancho de banda de HBM. Un sistema de ejemplo que utiliza ocho canales DDR5 tiene un ancho de banda teórico de 307 GB/s a 4800 MT/s con dos subcanales de 32 bits por canal. Suponiendo dos rangos por canal y 64 GB por DIMM, la capacidad total puede alcanzar 1 TB. Otro sistema de ejemplo, compuesto por ocho pilas HBM3, tiene un ancho de banda teórico de 5.3 TB/s a 5.2 Gbps, con 16 canales por pila y dos pseudocanales de 32 bits por canal. Con 24 GB por pila, la capacidad total es de 192 GB. Las dos arquitecturas reflejan prioridades diferentes: los DIMM convencionales proporcionan mayor capacidad, mientras que HBM sacrifica capacidad a cambio de un aumento de un orden de magnitud en el ancho de banda del sistema al situarse cerca de la GPU y ampliar la interfaz paralela. A nivel de núcleo, 256 E/S operando a 8 Gbps pueden proporcionar 256 GB/s de ancho de banda, mientras que ocho E/S operando a 8 Gbps proporcionan solo 8 GB/s. La comparación de recuento de bancos de ejemplo es 128 frente a 32. Al mismo tiempo, el rendimiento de HBM no está exento de costes de recursos: la combinación de diseño arquitectónico, empaquetado avanzado y complejidad de fabricación implica que ofrecer capacidad HBM3E equivalente consume aproximadamente tres veces más silicio que DDR5. En consecuencia, el escalado de HBM no es meramente una cuestión de proceso DRAM; también depende de la optimización coordinada de la tecnología de empaquetado, los circuitos de E/S, los procesos de interposer y los procesos CMOS. El informe resume los requisitos de memoria de IA en cuatro áreas: rendimiento, capacidad, escalabilidad y bajo consumo energético. El rendimiento abarca no solo velocidad y ancho de banda, sino también fiabilidad y tolerancia a fallos. Se requiere capacidad para alojar parámetros de modelos, archivos y cachés. El bajo consumo energético afecta a la eficiencia energética y al despliegue de dispositivos de IA en el borde. A medida que surgen E/S de mayor velocidad y diseños de sistema en paquete más grandes, las futuras direcciones de innovación incluyen PHY SERDES D2D optimizados para memoria, óptica coempaquetada (CPO), SiP de tipo CoWoS-L o CoWoS-R más grandes y sustratos de vidrio. Estas tecnologías amplían la conectividad y reducen las pérdidas en enlaces de alta velocidad, pero también incrementan la dificultad del codiseño de sistemas. La interacción entre chip y paquete es otro desafío clave. Los dispositivos HBM complejos e integrados heterogéneamente utilizan múltiples materiales cuyos coeficientes de expansión térmica no coincidentes pueden generar tensión termomecánica, afectando la integridad estructural y la fiabilidad a largo plazo. La fiabilidad, disponibilidad y capacidad de mantenimiento también afectan directamente al entrenamiento a gran escala. El registro de preentrenamiento de Llama 3 405B citado en el informe abarca 54 días, durante los cuales aproximadamente el 78% de las interrupciones inesperadas se atribuyeron a problemas de hardware confirmados o presuntos. Estos incluyeron 148 incidentes de GPU fallidas, que representaron el 30.1%; 72 incidentes de memoria HBM3 de GPU, que representaron el 17.2%; 54 defectos de software, que representaron el 12.9%; 35 incidentes de conmutadores o cables de red, que representaron el 8.4%; 32 incidentes de mantenimiento no planificado de hosts, que representaron el 7.6%; 19 incidentes de memoria SRAM de GPU, que representaron el 4.5%; y 17 incidentes de procesadores de sistema de GPU, que representaron el 4.1%. Estos datos muestran que el rendimiento de los clústeres de IA depende no solo del ancho de banda máximo, sino también de la estabilidad del hardware de memoria y cómputo durante una operación prolongada. Para abordar problemas de fiabilidad, HBM3 comenzó a proporcionar dos niveles de cobertura ECC. La cobertura a nivel de sistema proporciona 16 bits de metadatos por cada acceso de 256 bits, permitiendo al sistema aplicar CRC o ECC. La cobertura a nivel de dado implementa ECC Reed-Solomon basado en símbolos dentro de la DRAM. El informe sostiene que dicha protección de extremo a extremo es un componente importante para permitir que HBM admita entrenamiento continuo y computación de alta disponibilidad. La gestión térmica se volverá más difícil a medida que aumenten las interconexiones D2D de alta velocidad, la funcionalidad del dado base, la actividad de los dados DRAM y la altura de pila. El informe identifica la refrigeración líquida y la unión híbrida como medidas de respuesta importantes y además señala que el empaquetado avanzado debe avanzar simultáneamente en el escalado de E/S de densidad areal, incluidos microbumps, pads y TSV; el escalado de E/S lateral, incluidos anchos de línea y espaciados más finos; la partición de matrices y CMOS; y la gestión de puntos calientes y de la red de entrega de energía. Las rutas de apilamiento y unión incluyen CoS, CoW, C2C, C2W, W2W, microbumps, unión por fusión y unión híbrida, lo que indica que las futuras ganancias de rendimiento de HBM dependerán de una estrecha colaboración entre los ecosistemas de memoria, lógica, empaquetado, gestión térmica y fabricación. El informe concluye señalando que ChatGPT alcanzó 100 millones de usuarios en solo dos meses para ilustrar la velocidad a la que proliferan las aplicaciones de IA y, sobre esta base, enfatiza que la industria atraviesa una fase de aceleración sin precedentes. Su conclusión central es que HBM se ha convertido en un componente fundamental de la computación acelerada por IA, pero los aumentos continuos de ancho de banda y capacidad no pueden depender únicamente de actualizaciones de tecnologías de memoria individuales. Los desafíos relacionados con interconexiones de alta velocidad, tamaño de paquete, tensión de materiales, densidad térmica, corrección de errores y capacidad de mantenimiento del sistema también deben abordarse en paralelo.

Marco de análisis

El informe sigue la siguiente secuencia: requisitos de escalado de IA, cuellos de botella de memoria, principios operativos de HBM, evolución de especificaciones generacionales, comparaciones a nivel de sistema, empaquetado e interconexiones, y desafíos de fiabilidad y gestión térmica. Primero utiliza las leyes de escalado de modelos grandes y el modelo Roofline para explicar por qué el ancho de banda limita el rendimiento; después cuantifica las diferencias mediante tablas de especificaciones de HBM1 a HBM4, ejemplos de sistemas DDR5 y HBM, y datos de causas raíz de interrupciones de entrenamiento. Finalmente, propone las direcciones tecnológicas necesarias para el escalado continuo desde las perspectivas de chips, empaquetado, materiales, gestión térmica y corrección de errores.

Notas metodológicas

  • (Método fuera de la taxonomía)Otro

    Modelo de rendimiento Roofline

    Este modelo vincula el rendimiento de cómputo alcanzable con la intensidad aritmética y se utiliza para distinguir si las cargas de trabajo están limitadas por el ancho de banda de memoria o por la capacidad de cómputo. El informe lo utiliza para explicar cómo HBM eleva el límite de ancho de banda y mejora el rendimiento de las tareas de IA intensivas en memoria.

  • (Método fuera de la taxonomía)Otro

    Leyes de escalado de modelos grandes

    El informe cita el principio empírico de que el tamaño del modelo, el tamaño del conjunto de datos y el cómputo de entrenamiento deben escalarse simultáneamente para explicar cómo la memoria se convierte en un cuello de botella para mejoras adicionales del rendimiento de IA si no se actualiza junto con la capacidad de cómputo.

  • (Método fuera de la taxonomía)Otro

    Comparación de especificaciones generacionales y arquitectura de sistemas

    El informe compara los canales, E/S, tasas, ancho de banda, densidad y capacidad de HBM1 a HBM4, y sitúa un sistema DDR5 de ocho canales junto a un sistema HBM3 de ocho pilas para demostrar sus diferentes prioridades de capacidad y ancho de banda.

  • (Método fuera de la taxonomía)Otro

    Clasificación de causas raíz de interrupciones inesperadas

    El informe categoriza las interrupciones durante el preentrenamiento prolongado de modelos grandes por GPU, memoria HBM3, software, red, mantenimiento de hosts y otras causas, para ilustrar cómo la fiabilidad del hardware afecta al tiempo operativo efectivo de los clústeres de IA.

Datos clave

  • Cronología generacional de HBMHBM1 2014; HBM2 2018; HBM2E 2020; HBM3 2022; HBM3E 2024; HBM4 2026Hitos de evolución de productos presentados en el informe
  • Ancho de banda nominal de HBM128, 307, 460, 819, 1024, 2800 GB/sCorresponden respectivamente a HBM1, HBM2, HBM2E, HBM3, HBM3E y HBM4
  • Tasa de datos nominal de HBM1, 2.4, 3.6, 6.4, 8, 11 GbpsCorresponden respectivamente a HBM1 hasta HBM4
  • Canales y E/S de HBM432 canales, 64 pseudocanales y 2048 E/S de datosHBM3E tiene 16 canales, 32 pseudocanales y 1024 E/S de datos, respectivamente
  • Sistema DDR5 de ejemplo307 GB/s de ancho de banda teórico y 1 TB de capacidadOcho canales, 4800 MT/s y dos subcanales de 32 bits por canal; dos rangos por canal y 64 GB por DIMM
  • Sistema HBM3 de ejemplo5.3 TB/s de ancho de banda teórico y 192 GB de capacidadOcho pilas, 5.2 Gbps, 16 canales por pila y 24 GB de capacidad por pila
  • Consumo de silicio de HBM3EAproximadamente tres veces el de DDR5El informe atribuye esto a la sobrecarga combinada del diseño arquitectónico, el empaquetado avanzado y la complejidad de fabricación
  • Proporción de hardware en interrupciones inesperadas de entrenamientoAproximadamente 78%Atribuida a problemas de hardware confirmados o presuntos durante 54 días de preentrenamiento de Llama 3 405B
  • Principales categorías de interrupcionesGPU fallidas: 148 incidentes, 30.1%; memoria HBM3 de GPU: 72 incidentes, 17.2%; defectos de software: 54 incidentes, 12.9%Las tres principales categorías de causas raíz de interrupciones inesperadas presentadas en el informe
  • Metadatos de corrección de errores a nivel de sistema HBM316 bits de metadatos configurados para cada acceso de 256 bitsEl sistema puede usar CRC o ECC; también se proporciona ECC Reed-Solomon a nivel de dado
  • Velocidad de adopción de usuarios de ChatGPTAlcanzó 100 millones de usuarios en 2 mesesUtilizado en el informe para ilustrar la velocidad de adopción de aplicaciones de IA

Impacto e implicaciones

El informe sostiene que el diseño de sistemas de IA está pasando de una búsqueda singular del máximo rendimiento de cómputo de GPU hacia la optimización coordinada de cómputo, memoria, interconexiones y empaquetado. HBM puede aumentar significativamente la velocidad de entrega de datos, pero un mayor ancho de banda y capacidad también incrementan el consumo de silicio, la densidad de E/S, la altura de pila y la carga térmica. Por lo tanto, el futuro escalado del rendimiento depende de si el empaquetado avanzado, D2D de alta velocidad, la refrigeración líquida, la unión híbrida, ECC y la colaboración intersectorial pueden avanzar simultáneamente.

Riesgos

  • Si el ancho de banda de memoria no puede escalar simultáneamente con el tamaño del modelo y la capacidad de cómputo, los procesadores no podrán utilizar plenamente su potencia de cómputo mientras esperan los datos.
  • Los coeficientes de expansión térmica no coincidentes entre diferentes materiales en el empaquetado heterogéneo HBM pueden generar tensión termomecánica, creando riesgos de interacción entre chip y paquete.
  • Los aumentos en interconexiones de alta velocidad, funcionalidad del dado base, actividad DRAM y altura de pila elevarán la densidad térmica y dificultarán la disipación de calor.
  • El entrenamiento prolongado de IA es muy sensible a la fiabilidad del hardware; aproximadamente el 78% de las interrupciones inesperadas en el registro de entrenamiento citado de 54 días estuvieron asociadas a problemas de hardware confirmados o presuntos.
  • La capacidad HBM3E requiere aproximadamente tres veces más silicio que DDR5, mientras que el diseño avanzado y la complejidad de empaquetado y fabricación crean desafíos de recursos y producción.

Aspectos que vigilar

  • Si los 32 canales, 64 pseudocanales, 2048 E/S y 2800 GB/s de ancho de banda nominal de HBM4 pueden respaldar la siguiente etapa de cargas de trabajo de IA.
  • El progreso en PHY SERDES D2D optimizados para memoria, óptica coempaquetada e interposers SiP más grandes.
  • Las mejoras de la refrigeración líquida y la unión híbrida para abordar los problemas de gestión térmica provocados por una mayor actividad DRAM y pilas más altas.
  • La evolución de tecnologías de empaquetado avanzado como microbumps, TSV, escalado de ancho de línea y espaciado, y sustratos de vidrio.
  • Las mejoras en fiabilidad y capacidad de mantenimiento del entrenamiento de IA mediante CRC o ECC a nivel de sistema y ECC Reed-Solomon a nivel de dado.

Configuración

Inicia sesión para ver los accesos recientes