Memoria de semiconductores y arquitectura de computación de IA: El dado base HBM evolucionará de una capa de interfaz a una plataforma de sistema de IA para control, expansión y computación cerca de la memoria
El informe propone una hoja de ruta de evolución en tres etapas: primero, utilizar procesos lógicos avanzados e interfaces D2D compactas para liberar área de xPU; después, añadir RAS, expansión de memoria externa y unidades de procesamiento al dado base; y, por último, lograr la integración vertical 3D de la xPU y la pila DRAM mediante zHBM.
Resumen
El informe propone una hoja de ruta de evolución en tres etapas: primero, utilizar procesos lógicos avanzados e interfaces D2D compactas para liberar área de xPU; después, añadir RAS, expansión de memoria externa y unidades de procesamiento al dado base; y, por último, lograr la integración vertical 3D de la xPU y la pila DRAM mediante zHBM.
- El recuento y el paso de TSV, junto con el número y la velocidad de E/S del PHY del dado base, se han convertido en los principales cuellos de botella para un mayor escalado del ancho de banda.
- A partir de HBM4, se considera necesario adoptar procesos lógicos avanzados para el dado base a fin de contener el crecimiento del consumo energético y reducir el área efectiva.
- Un PHY D2D compacto puede acortar los canales, reducir la energía por bit y devolver área a la xPU o ponerla a disposición de nuevas funciones del dado base.
- Cuando HPB cubre más del 50% de la región PHY, puede reducir la temperatura máxima en más del 35%.
- La segunda etapa integra sensores, autoprueba, control de memoria externa y unidades de procesamiento en el dado base.
- La tercera etapa, zHBM, elimina los PHY HBM convencionales, las interfaces D2D y los interposers 2.5D mediante E/S distribuida e integración vertical.
Interpretación del informe
Visión general
El informe analiza cómo está cambiando el papel del dado base HBM ante la demanda de computación impulsada por la IA. Su visión central es que las limitaciones de ancho de banda, energía, área y capacidad impulsarán una transición desde HBM estándar hacia HBM personalizado que utilice procesos lógicos avanzados, siguiendo una evolución en tres etapas de «recuperación de área de xPU—expansión funcional—integración 3D».
Perspectivas principales
El informe distingue primero entre el dado central y el dado base en una pila HBM: el dado central contiene celdas DRAM, lógica central y TSV, mientras que el dado base proporciona la ruta PHY-a-TSV para la comunicación con el dado de computación, así como funciones de prueba del dado central como DA, MBIST e IEEE 1500. A medida que un mayor ancho de banda se convierte en el principal impulsor de las sucesivas generaciones de HBM, la arquitectura convencional enfrenta dos cuellos de botella directos: primero, limitaciones en el recuento y el paso de TSV en el dado base y la pila de dados centrales; y segundo, limitaciones en el número y la velocidad de E/S del PHY del dado base. Por ello, el informe sostiene que el rápido escalado del ancho de banda requiere cambios fundamentales en el dado base. La evolución de procesos proporciona la base para esta transformación. La hoja de ruta presentada en el informe muestra que el dado base pasa de 2*nm a 1*nm entre HBM2 y HBM3E, mientras que HBM4 y HBM4E cambian a un proceso lógico de 4nm. Durante el mismo período, el SoC xPU evoluciona de 16n/12nm en 2016 a 3nm para HBM4 y por debajo de 3nm para HBM4E. Samsung utiliza DRAM D1c y un proceso lógico de 4nm en HBM4. El informe destaca que, aunque la eficiencia energética por unidad continúa mejorando, el consumo total de energía MPGA sigue aumentando. Por tanto, a partir de HBM4, utilizar procesos lógicos avanzados para el dado base es crucial para contener el crecimiento del consumo energético. También reduce el área efectiva y estrecha la brecha de proceso entre el dado base y el SoC xPU. Esto se define como el inicio de una verdadera integración entre DRAM y lógica avanzada. Sobre esta base, el informe distingue el HBM estándar del HBM personalizado. El dado base en HBM estándar proporciona principalmente rutas básicas de datos y prueba, y la mayor parte de su área se utiliza pasivamente para enrutamiento. En cambio, el HBM personalizado comparte una pila estándar de dados centrales mientras utiliza procesos lógicos avanzados para personalizar el dado base y dotarlo de funcionalidad similar a la de un SoC. La motivación es que los métodos convencionales para escalar las xPU se aproximan a límites físicos: el escalado de proceso se está ralentizando, los dados monolíticos se acercan al límite de tamaño de retícula, y las dimensiones de los interposers en soluciones multichiplet también se acercan a sus límites. Dado que el dado base ya utiliza un proceso lógico avanzado y dispone de una importante área disponible, el informe propone migrar algunas funciones de xPU al dado base. La primera etapa se centra en recuperar área de xPU y optimizar la interfaz. El PHY HBM convencional ocupa la mayor región funcional del dado base, y desde HBM2 hasta HBM4 estándar, su huella y longitud de canal continuaron aumentando para admitir mayor ancho de banda. El HBM personalizado sustituye el PHY HBM convencional por una interfaz D2D implementada mediante un proceso lógico avanzado. Una huella de interfaz menor y canales más cortos pueden reducir pJ/b, mejorar la eficiencia energética y liberar valiosa área de silicio para la expansión de xPU. El informe identifica HBM4 hasta HBM5 como un período de inflexión en el que los procesos lógicos avanzados reducen significativamente el área PHY y D2D. Sin embargo, esta reducción de área también incrementa la densidad de potencia y crea puntos calientes térmicos. La comparación del informe muestra que sHBM4E tiene una velocidad de E/S de 14Gbps y una densidad de potencia de 0.5W/mm², mientras que sHBM5 tiene una velocidad de E/S superior a 28Gbps, aproximadamente 2 veces la de sHBM4E, y una densidad de potencia superior a 2.0W/mm². Para abordar este problema, el informe propone un bloque de trayectoria térmica HPB basado en la experiencia de Samsung con cHBM4. Cuando HPB cubre más del 50% de la región PHY, la temperatura máxima puede reducirse en más del 35%. La primera etapa también incluye migrar el controlador de memoria desde el SoC xPU al dado base HBM personalizado. El informe considera al controlador de memoria como el principal candidato para migración porque esta disposición puede recuperar área de xPU manteniendo manejable el impacto térmico del controlador añadido. Los controladores de memoria HBM convencionales están siendo actualmente adaptados a cHBM. Una vez que el controlador se sitúa más cerca de la memoria, el espacio no utilizado del dado base también puede utilizarse para recursos de reparación SRAM que proporcionan decodificación y redirección de direcciones de grano fino para celdas defectuosas y comparten capacidad de reparación entre canales. En comparación con los recursos limitados e inflexibles de reparación de filas y columnas en el dado central, la solución SRAM del dado base ofrece mayor capacidad y más flexibilidad de configuración. La segunda etapa utiliza el área del dado base que permanece disponible después de la migración del controlador de memoria para añadir funciones. La primera categoría es RAS y pruebas: cHBM puede integrar de forma nativa sensores de temperatura, voltaje, proceso y envejecimiento para proporcionar telemetría en tiempo real y de alta velocidad. Mecanismos de autoprueba en chip como OD-ATE y PGEN pueden ampliar la cobertura de pruebas y mejorar el rendimiento de fabricación. La segunda categoría es la expansión de capacidad. El informe señala que las ventanas de contexto de los modelos de IA están creciendo 30 veces por año, incrementando significativamente los requisitos de caché KV, mientras que el almacenamiento y la recuperación de memoria a largo plazo siguen siendo importantes cuellos de botella para los modelos de IA de próxima generación. Por ello, los SoC de IA requieren urgentemente mayor capacidad de memoria además de ancho de banda. El dado base puede utilizar su borde exterior para conectarse directamente a memoria externa e integrar PHY y controladores dedicados. El informe sostiene que este enfoque puede ofrecer un ancho de banda significativamente mayor y una latencia más baja que la expansión PCIe convencional. La segunda etapa también puede migrar parte del cómputo de xPU a unidades de procesamiento en el dado base. Dado que los datos se procesan más cerca de la memoria, se pueden reducir los requisitos de ancho de banda D2D, el movimiento de datos, el consumo energético y la carga térmica. En soluciones HBM avanzadas dentro de sistemas 2.5D, las unidades de procesamiento del dado base también pueden reducir significativamente el movimiento de datos a través del interposer, mejorando así la eficiencia energética a nivel de sistema. Sin embargo, este enfoque está limitado por el área de silicio restringida del dado base y por el aumento de la densidad térmica local causado por las unidades de procesamiento. Por tanto, la escala funcional debe equilibrar los beneficios computacionales, el área y la disipación térmica. La tercera etapa es la verdadera integración 3D representada por zHBM. El informe sostiene que las arquitecturas de memoria para IA avanzan rápidamente hacia un acoplamiento estrecho, siendo el objetivo clave en escenarios de AGI e inferencia aumentar el ancho de banda y TPS bajo estrictas restricciones de energía. zHBM integra verticalmente la xPU con la pila de dados centrales y elimina el interposer 2.5D. La E/S distribuida acorta las rutas de datos dentro de la pila al tiempo que elimina interfaces bidimensionales como los PHY HBM convencionales o las interfaces D2D. El principal beneficio es una reducción sustancial del consumo energético de E/S: eliminar la alineación de datos y la E/S DQ de SERDES puede eliminar sobrecarga de energía innecesaria y convertir la energía ahorrada y el margen térmico en mayor rendimiento computacional del sistema. El informe utiliza «1 GPU más 4 HBM4E» y «1 GPU más 4 zHBM» como base para una comparación de arquitectura de sistema, pero no proporciona resultados cuantitativos específicos. La implementación de zHBM todavía depende de capacidades críticas de proceso y codiseño. La unión de oblea a oblea y la unión híbrida de cobre deben proporcionar una densidad de E/S ultraalta. El proceso mostrado en el informe incluye la unión a nivel de oblea de 4 capas de dados centrales con una xPU o una capa intermedia. Asimismo, el SoC y la DRAM deben coarquitectarse utilizando un flujo unificado de diseño y verificación. En general, el informe considera al dado base de lógica avanzada como el elemento central de la evolución: la primera etapa recupera área de xPU mediante un PHY D2D compacto y la migración del controlador; la segunda etapa añade telemetría, pruebas, expansión de capacidad y unidades de procesamiento; y la tercera etapa utiliza zHBM para eliminar interfaces bidimensionales y 2.5D, logrando una integración vertical directa de la lógica xPU con la pila DRAM y la máxima eficiencia energética.
Marco de análisis
El informe parte de la división actual de responsabilidades entre el dado central HBM y el dado base e identifica cuellos de botella de escalado relacionados con TSV, PHY, consumo energético y dimensiones de encapsulado. Después utiliza los cambios generacionales en procesos e interfaces desde HBM2 hasta HBM4E para demostrar la necesidad de adoptar procesos lógicos avanzados. A continuación, bajo las restricciones de área, longitud de canal, energía por bit, densidad de potencia y puntos calientes térmicos, evalúa secuencialmente interfaces D2D, HPB, migración del controlador de memoria, reparación SRAM, RAS y pruebas, expansión de capacidad, computación cerca de la memoria e integración 3D, formando finalmente una hoja de ruta arquitectónica en tres etapas.
Notas metodológicas
Hoja de ruta de evolución arquitectónica en tres etapas
El informe divide la evolución del dado base en tres etapas —recuperación de área de xPU, expansión funcional adicional y verdadera integración 3D— para explicar la secuencia de implementación y las dependencias entre tecnologías.
Comparación de parámetros generacionales de HBM
El informe compara los años y procesos de HBM2 a HBM4E, así como las velocidades de E/S y densidades de potencia de sHBM4E y sHBM5, para identificar el punto de inflexión creado por los procesos lógicos avanzados y las nuevas restricciones térmicas resultantes.
Equilibrio a nivel de sistema entre energía, área, ancho de banda y disipación térmica
En lugar de examinar únicamente el chip de memoria, el informe evalúa simultáneamente cómo las interfaces más cortas, la migración funcional y la integración vertical afectan el área de xPU, el movimiento de datos, la energía de E/S, la densidad térmica local y el margen para el rendimiento del sistema.
Datos clave
- Cronología de evolución de procesos HBM2016 HBM2; 2019 HBM2E; 2021 HBM3; 2023 HBM3E; 2026 HBM4; 2027 HBM4EGeneraciones HBM y años presentados en el informe
- Proceso del dado base HBM4/4E4nmEl proceso del dado base evolucionó previamente de 2*nm a 1*nm entre HBM2 y HBM3E
- Proceso del dado central HBM4D1c/1*nmEl informe indica que Samsung utiliza DRAM D1c y un dado base lógico de 4nm en HBM4
- Evolución de proceso del SoC xPU16n/12nm en 2016; 8n/4nm en 2019; 4nm en 2021—2023; 3nm en 2026; <3nm en 2027Correspondiente a la hoja de ruta de HBM2 a HBM4E
- Velocidad de E/S de sHBM4E14GbpsReferencia para la comparación de densidad térmica con sHBM5
- Velocidad de E/S de sHBM5>28GbpsAproximadamente 2 veces la de sHBM4E
- Densidad de potencia PHY0.5W/mm² para sHBM4E; >2.0W/mm² para sHBM5El riesgo de puntos calientes térmicos aumenta a medida que el PHY se reduce y acelera
- Reducción de temperatura máxima HPB>35%Cuando la cobertura PHY es >50%
- Tasa de crecimiento de la ventana de contexto de IA30 veces/añoUtilizada en el informe para ilustrar el rápido crecimiento de los requisitos de caché KV y capacidad de memoria
- Configuración de comparación de sistema zHBM1 GPU + 4 HBM4E, comparado con 1 GPU + 4 zHBMEl informe no proporciona resultados cuantitativos específicos para esta comparación
Impacto e implicaciones
El informe sostiene que las dimensiones de la competencia en HBM se ampliarán más allá del ancho de banda para incluir eficiencia energética de interfaz, utilización del área de xPU, RAS, pruebas, expansión de capacidad y computación cerca de la memoria. Los dados base de lógica avanzada permiten desplegar más funciones del sistema más cerca de la DRAM, mientras que zHBM amplía aún más el alcance de la optimización desde un dispositivo de memoria individual hasta el nivel arquitectónico conjunto de xPU, DRAM y encapsulado. En consecuencia, la disipación térmica, la unión de ultraalta densidad y las capacidades unificadas de diseño y verificación se convertirán en restricciones críticas para materializar estos beneficios.
Riesgos
- Las limitaciones físicas relacionadas con el recuento y el paso de TSV, el número y la velocidad de E/S PHY, y las dimensiones de retícula e interposer pueden limitar un mayor escalado del ancho de banda en HBM convencional.
- Reducir el área PHY aumenta la densidad de potencia y crea puntos calientes térmicos; el informe muestra que la densidad de potencia PHY de sHBM5 supera 2.0W/mm².
- El despliegue de unidades de procesamiento en el dado base está sujeto a las restricciones duales de área de silicio disponible limitada y mayor densidad térmica local.
- La implementación de zHBM depende de la unión de oblea a oblea, la unión híbrida de cobre y un flujo unificado de diseño y verificación SoC—DRAM.
Aspectos que vigilar
- Supervisar si HPB puede lograr su objetivo de más del 50% de cobertura PHY y mantener una reducción de temperatura máxima superior al 35% a velocidades de E/S HBM5 por encima de 28Gbps.
- Supervisar el progreso en la adaptación de controladores de memoria HBM convencionales al dado base cHBM.
- Supervisar la integración práctica de expansión de memoria externa del dado base, sensores RAS en chip, autoprueba y unidades de procesamiento.
- Supervisar cómo WoW, la unión híbrida de cobre y un flujo unificado de diseño y verificación SoC—DRAM respaldan zHBM.