Global AI memory — Interpretación del informe
Bernstein explica que el entrenamiento, la inferencia, RAG y los flujos agénticos generan distintos cuellos de botella de memoria y fomentan una jerarquía más amplia de tecnologías de memoria para IA. El informe destaca la inferencia intensiva en caché KV como catalizador clave de innovación en capacidad, ancho de banda y memoria de menor coste.
Resumen
Bernstein explica que el entrenamiento, la inferencia, RAG y los flujos agénticos generan distintos cuellos de botella de memoria y fomentan una jerarquía más amplia de tecnologías de memoria para IA. El informe destaca la inferencia intensiva en caché KV como catalizador clave de innovación en capacidad, ancho de banda y memoria de menor coste.
- El entrenamiento requiere todos los niveles de memoria: HBM es crítico para ancho de banda, mientras DRAM, SSD y almacenamiento en red son necesarios para datos, preparación y puntos de control.
- El prefill de inferencia está limitado por cómputo, mientras la decodificación está limitada por memoria debido al crecimiento de la caché KV con tokens y usuarios concurrentes.
- El informe ordena una jerarquía arquitectónica desde SRAM integrada, HBM, memoria de sistema, CXL y Storage Next hasta SSD local, CMX y almacenamiento compartido.
- HBF busca combinar capacidad y menor coste de NAND con ancho de banda de HBM, pero Bernstein considera técnicamente exigente el salto de rendimiento requerido.
- Las nuevas arquitecturas pueden redistribuir valor entre proveedores de memoria, diseñadores de GPU, fundiciones, empaquetadores y proveedores de almacenamiento.
Interpretación del informe
Visión general
Este informe introductorio construye un marco para entender las necesidades de memoria de IA y las tecnologías que buscan resolverlas. Bernstein sostiene que la IA no crea un mercado de memoria uniforme: la carga de trabajo y la ubicación de los datos determinan si importan más ancho de banda, baja latencia, capacidad, coste o acceso compartido.
Perspectivas principales
Bernstein parte de que las cargas de trabajo de IA imponen requisitos de memoria distintos. El entrenamiento es muy intensivo en cómputo y a menudo está limitado por el ancho de banda, por lo que HBM es crítico. Sin embargo, los grandes conjuntos de datos deben prepararse y guardarse en almacenamiento más lento y barato, y después almacenarse temporalmente en niveles más rápidos antes de copiarse a HBM. Dado que el entrenamiento puede durar meses, se necesitan puntos de control para evitar reiniciar desde el principio tras fallos de hardware o software. Por ello, DRAM de sistema, SSD local y almacenamiento en red son esenciales junto con HBM, no sustitutos de este. Para la inferencia Transformer, el informe distingue entre prefill y decodificación. El prefill procesa el prompt y genera el primer token mediante grandes operaciones matriz-matriz; generalmente está limitado por cómputo, por lo que el rendimiento del acelerador y HBM son relativamente más importantes. Bernstein identifica TTFT como la métrica clave: alrededor de 0.5 segundos o menos es ideal para chatbots, 1 segundo es aceptable y más de 2 segundos puede ser tolerable para tareas grandes, pero probablemente cause frustración o abandono del prompt en muchos casos. La decodificación genera tokens de forma autorregresiva. Para evitar recálculos, los tokens anteriores se guardan como pares clave-valor, lo que hace que el requisito de caché KV crezca linealmente con el número de tokens. A diferencia de los pesos estáticos y de solo lectura, la caché KV se actualiza con cada token, es distinta para cada usuario y crece con los usuarios concurrentes. Bernstein califica por tanto la decodificación como limitada por memoria: el crecimiento combinado de longitud de contexto y concurrencia puede hacer que la caché KV exceda los pesos del modelo, limite las ventanas de contexto y la capacidad de usuarios, y determine la escala de despliegue y de ingresos de un modelo de IA. TPOT es la métrica relevante; el informe cita 50ms, o 20 tokens por segundo, como potencialmente aceptable para chat de texto, frente a menos de 10ms para voz en tiempo real, programación y aplicaciones agénticas exigentes. RAG añade un perfil de almacenamiento diferente. La generación de bases de datos procesa grandes volúmenes de documentos, código o páginas web para crear bases de datos vectoriales e índices buscables. Requiere gran capacidad de almacenamiento, preferiblemente SSD frente a HDD para reducir el tiempo de acceso, y gran cantidad de DRAM de sistema para generar índices, mientras HBM es relativamente menos importante. Es además una carga offline y un coste único, independiente de usuarios o tokens. En la búsqueda, la incrustación de consultas puede usar HBM rápidamente, pero encontrar la coincidencia más cercana normalmente hace que DRAM de sistema sea más importante que HBM y SSD. Los datos recuperados vuelven luego a prefill y decodificación. Los flujos agénticos amplifican las necesidades al añadir planificación iterativa, herramientas, entornos externos y conservación de estados intermedios; también elevan la demanda de CPU y memoria convencional, mientras las salidas entre agentes generan repetidamente carga adicional de prefill, decodificación y caché KV. El informe organiza estas necesidades en una jerarquía arquitectónica. En la parte superior está la memoria G0, usualmente SRAM incorporada al acelerador para cálculos inmediatos y sensibles a la latencia. HBM G1 se sitúa justo debajo y se empaqueta con el acelerador para alto ancho de banda y baja latencia. La memoria de sistema G2 es DRAM de mayor capacidad pero más lenta, gestionada por CPU, aunque determinadas GPU pueden acceder a ella directamente. CXL se clasifica como G2.5 porque agrupa lógicamente memorias físicamente separadas y puede extenderse a productos NAND hechos más similares a DRAM mediante caché. Storage Next de NVIDIA se considera G2.6: una iniciativa centrada en GPU que pretende combinar el coste y la capacidad de NAND con latencia, IOPS y granularidad de acceso más cercanas a DRAM, a menudo mediante híbridos DRAM/SRAM y NAND. Por debajo están el SSD local G3, que amplía capacidad local pero no se comparte entre un pod, y CMX G3.5, la capa de almacenamiento de contexto de NVIDIA para caché KV. Los SSD compatibles con CMX se ubican en nodos de datos y pueden ser accedidos por varios nodos de cómputo mediante Ethernet, conmutación Spectrum-X y DPU BlueField-4; las GPU pueden acceder sin intervención de CPU. Bernstein describe STX como la arquitectura de referencia de NVIDIA para integrar almacenamiento CMX y soluciones ODM compatibles. El almacenamiento compartido G4 consiste en SSD, HDD o cinta para datos persistentes fuera de la ruta crítica inmediata. HDD sigue siendo adecuado para datos fríos de bajo coste y acceso poco frecuente, y se beneficia de necesidades crecientes de almacenamiento y desbordamiento de caché KV; la demanda de cinta también puede crecer si NAND y HDD no bastan. La jerarquía de hardware explica los compromisos de coste, latencia y tecnología. SRAM es más rápida que DRAM, pero ocupa más área de silicio; normalmente se incorpora a matrices lógicas como caché, donde L1 está más cerca del cómputo y tiene la menor capacidad. La DRAM embebida puede competir con SRAM en cachés mayores, pero mantiene una cuota pequeña. HBM es DRAM y comparte capacidad de obleas con DRAM convencional; esta última también puede utilizarse en memoria de sistema y CXL. Bernstein señala que la evolución tecnológica de DRAM sigue impulsada principalmente por el escalado litográfico y sostiene que EUV es necesario para DRAM avanzada; considera que la falta de EUV en China limita a largo plazo la competitividad de CXMT. La DRAM 4F² representa un beneficio puntual de densidad al reubicar circuitos periféricos, mientras la DRAM 3D podría ofrecer una trayectoria de escalado más larga, pero es tecnológicamente más difícil y está a años de la comercialización. Diversas innovaciones pretenden mejorar la memoria de alto rendimiento, con riesgos de implementación diferenciados. zHBM de Samsung colocaría HBM sobre el acelerador para acortar conexiones, pero Bernstein cuestiona si la DRAM soportará el calor del procesador y si el rendimiento y coste del enlace híbrido están listos para producción comercial. NVHBM de NVIDIA traslada las funciones de controlador de memoria a un dado base diseñado por NVIDIA, lo que podría reducir el coste del acelerador o liberar área para cómputo, y mejorar ancho de banda y consumo. Sin embargo, Bernstein sostiene que estandariza parte de la diferenciación del dado base de los proveedores de memoria y desplaza valor de fabricación hacia fundiciones, probablemente TSMC. XBM de Intel se presenta como un concepto emergente de DRAM de back-end que puede coexistir con lógica y ser candidato a procesamiento en memoria, aunque la compatibilidad de fabricación y el productor futuro son inciertos. ZAM de Intel reorienta las matrices DRAM para mejorar la disipación térmica; su objetivo declarado de uso práctico es FY2029 y la transmisión inalámbrica entre las matrices reorientadas es un desafío. HBC de Qualcomm sacrifica rendimiento frente a HBM para evitar costes de CoWoS e interposer, usa LPDDR para menor consumo y apunta a primera generación en el ejercicio fiscal 2027 y segunda generación en 2028. Las innovaciones de módulos MRDIMM, SOCAMM2 y LPCAMM2 buscan elevar el rendimiento de memoria de sistema. MRDIMM añade chips de interfaz para mayor ancho de banda. SOCAMM2 usa LPDDR, un bus de datos de 128-bit y un perfil más bajo para reducir consumo, aumentar el ancho de banda por módulo y mejorar el flujo de aire en servidores de IA. PIM combina lógica y memoria para reducir el tráfico de datos, un cuello de botella central de los ordenadores, pero Bernstein destaca que la adopción es limitada porque se aparta de la separación dominante entre procesamiento y memoria y exige cambios en procesadores, software, redes y la cadena de suministro establecida de lógica y memoria. En memoria de clase almacenamiento, Bernstein sitúa las tecnologías entre DRAM y NAND. MRAM, PCM y RRAM utilizan mecanismos fundamentalmente distintos de DRAM y NAND; los enfoques NAND mejorados persiguen más IOPS, menor latencia y mayor granularidad mediante caché o compromisos de modo de celda. XL-FLASH de KIOXIA usa SLC y posteriormente MLC para SSD GP de alto IOPS; el informe cita hasta 10M IOPS este año y 100M+ en 2027. Z-NAND/Z-SSD de Samsung también apunta a latencia ultrabaja. Bernstein asigna productos SLC/MLC a usos tipo Storage Next, TLC a productos CMX que equilibran rendimiento y coste, y QLC a productos de gran capacidad que compiten con HDD. XTR SSD de Micron se cita como ejemplo de pSLC, que utiliza solo parte de celdas capaces de TLC para almacenar 1 bit y lograr resistencia y velocidad similares a SLC. HBF, liderada por SanDisk y SK hynix, es el intento clave basado en NAND para complementar HBM: busca un ancho de banda similar a HBM con mayor capacidad y menor coste por bit, y se sitúa conceptualmente como capa G1.5. El informe subraya que lograrlo exige que NAND salte varios niveles de la jerarquía de hardware, por lo que la barrera tecnológica es alta. zNAND-O de Samsung se posiciona para IA en dispositivo, usa TLC para gran capacidad y se empaqueta cerca del procesador. En conjunto, el marco de Bernstein implica que el crecimiento de IA amplía el mercado direccionable de toda la pila de memoria y almacenamiento, pero el beneficio económico variará según carga de trabajo, capa, viabilidad de implementación y quién capture valor en la integración tecnológica.
Marco de análisis
Bernstein primero vincula cada carga de trabajo principal de IA con su cuello de botella de rendimiento y sus necesidades de memoria, y después las sitúa en una jerarquía arquitectónica basada en la posición de la memoria en el sistema y en una jerarquía de hardware basada en la estructura de celdas y el mecanismo de almacenamiento. Compara latencia, ancho de banda, capacidad, coste, empaquetado e implicaciones para la cadena de suministro.
Notas metodológicas
Asignación de cargas de trabajo de IA a capas de memoria
El informe sigue cómo las necesidades de carga de trabajo se transmiten a aceleradores, DRAM, NAND, SSD, almacenamiento, empaquetado y proveedores, mostrando por qué distintas partes de la cadena de memoria pueden beneficiarse o afrontar presión.
Compromiso entre rendimiento, capacidad y coste de tipos de memoria
El informe compara memoria rápida y de alto coste con alternativas de menor coste y mayor capacidad para explicar la lógica de HBF, CXL, Storage Next y productos de memoria de clase almacenamiento.
Correspondencia y comparación de activos
Correspondencia estructurada entre la tesis y activos concretos (fortalezas, debilidades, pares y riesgos).
- Samsung Electronics (005930.KS)Proveedor de memoria cubierto; el informe analiza zHBM, Z-NAND y productos de memoria CXL.
- Fortalezas
- Desarrolla ofertas zHBM, CMM-H y Z-NAND/Z-SSD en nuevas capas de memoria para IA.
- Debilidades
- Bernstein cuestiona la gestión térmica de zHBM y la preparación en rendimiento y coste del enlace híbrido.
- Comparación
- Compite con otros proveedores de HBM y DRAM; NVHBM podría reducir la diferenciación del dado base.
- Riesgos
- Preparación comercial de zHBM y exigencias de escalado tecnológico.
- SK hynix (000660.KS)Proveedor de memoria cubierto y codirector de HBF.
- Fortalezas
- Participa en HBM y lidera HBF junto con SanDisk.
- Comparación
- HBF busca complementar HBM con NAND de mayor capacidad y menor coste.
- Riesgos
- HBF requiere un salto tecnológico sustancial del NAND.
- Micron (MU)Proveedor de memoria cubierto; citado por el SSD XTR basado en pSLC y la tecnología de módulos DRAM.
- Fortalezas
- Participa en enfoques avanzados de DRAM y SSD basados en NAND.
- Comparación
- Compite con Samsung y SK hynix en memoria para IA; NVHBM podría estandarizar la diferenciación del dado base.
- Riesgos
- NVHBM podría trasladar valor desde los proveedores de memoria hacia NVIDIA y las fundiciones.
- KIOXIA (285A.JP)Proveedor de NAND y SSD cubierto; su SSD de la serie GP ilustra Storage Next y XL-FLASH.
- Fortalezas
- XL-FLASH sustenta productos SSD de alto IOPS para usos de memoria de clase almacenamiento.
- Comparación
- Su enfoque basado en SLC/MLC se dirige a capas más rápidas, mientras TLC y QLC atienden respectivamente CMX y almacenamiento orientado a capacidad.
- Riesgos
- La economía del producto exige compromisos entre capacidad, coste y modos de celda de mayor rendimiento.
- SanDisk (SNDK)Proveedor de almacenamiento cubierto y codirector de HBF.
- Fortalezas
- Lidera HBF junto con SK hynix, con el objetivo de mayor capacidad y menor coste por bit que HBM.
- Comparación
- HBF se sitúa entre HBM y el almacenamiento NAND de niveles inferiores.
- Riesgos
- El informe identifica una elevada barrera tecnológica para lograr rendimiento suficiente de HBF.
- Seagate (STX)Proveedor de almacenamiento cubierto vinculado a la demanda de almacenamiento compartido.
- Fortalezas
- HDD sigue siendo una opción de bajo coste para datos fríos y podría beneficiarse del desbordamiento de caché KV.
- Debilidades
- HDD está fuera de la ruta crítica inmediata y es mucho más lento que la memoria flash.
- Comparación
- Compite con SSD de gran capacidad y cinta en almacenamiento compartido G4.
- Riesgos
- Su función depende de la demanda de capacidad de bajo coste, no de cargas sensibles a la latencia.
- Western Digital (WDC)Proveedor de almacenamiento cubierto vinculado a la demanda de SSD y almacenamiento compartido.
- Fortalezas
- Tiene exposición a la expansión de la demanda de almacenamiento de datos de IA en flash y distintas capas de almacenamiento.
- Comparación
- Las tecnologías de almacenamiento se diferencian por latencia, IOPS, resistencia, capacidad y coste.
Datos clave
- TTFT ideal para chatbot0.5 second or lowerBernstein lo cita como tiempo ideal hasta el primer token.
- TTFT aceptable para chatbot1 secondUn TTFT superior a 2 segundos puede ocasionar frustración o abandono del prompt.
- TPOT para chat de texto50ms, or 20 tokens per secondVelocidad de salida potencialmente aceptable para chat de texto.
- TPOT para usos de alto nivelLess than 10msRelevante para voz en tiempo real, programación y cargas agénticas.
- Rendimiento del SSD serie GP de KIOXIAUp to 10M IOPS this year and 100M+ in 2027Citado para el posicionamiento de memoria de clase almacenamiento y alto IOPS basado en XL-FLASH.
- Hoja de ruta de Qualcomm HBCGen-1 in fiscal 2027; Gen-2 in 2028Alternativa basada en LPDDR que sacrifica rendimiento a cambio de menor coste.
- Objetivo de Intel ZAMFY2029Objetivo declarado de uso práctico del concepto de empaquetado DRAM orientado a la gestión térmica.
Impacto e implicaciones
El informe indica que la demanda de infraestructura de IA va más allá de HBM: la caché KV en decodificación, las bases de datos RAG y los flujos agénticos crean funciones para DRAM, SSD, HDD, cinta, agrupación de memoria y nuevas capas intermedias. También sugiere que las decisiones de arquitectura e integración pueden redistribuir valor entre fabricantes de memoria, diseñadores de GPU, fundiciones, proveedores de empaquetado y proveedores de almacenamiento.
Riesgos
- HBF afronta una alta barrera tecnológica porque NAND debe lograr un gran salto de rendimiento para complementar HBM.
- zHBM puede afrontar desafíos térmicos y de rendimiento y coste del enlace híbrido antes de la producción comercial.
- La adopción de PIM sigue limitada porque requiere cambios amplios en procesadores, software, redes y cadenas de suministro.
- La DRAM 3D es tecnológicamente más difícil y su comercialización está aún a años de distancia.
- NVHBM podría reducir la diferenciación y el valor capturado por los diseños de dado base de los proveedores de memoria.
Aspectos que vigilar
- El crecimiento de la caché KV frente a los pesos del modelo conforme aumenten las ventanas de contexto y los usuarios concurrentes.
- Si la capacidad HBM puede ampliarse a un coste asequible o si las cargas se desplazan a DRAM, NAND y nuevas capas intermedias.
- El avance de CXL, Storage Next, CMX e implementaciones de almacenamiento directo desde GPU.
- La ejecución comercial de HBF, zHBM, NVHBM, XBM, ZAM y HBC.
- La adopción de tecnologías NAND de alto IOPS como XL-FLASH, Z-NAND y productos pSLC.