Interpretación de informes
Cobertura de los estudios más recientes de los principales bancos de inversión de Wall Street
Interpretación del informeHilo Research

Global AI memory — Interpretación del informe

El informe sostiene que entrenamiento, inferencia, RAG y flujos de trabajo de agentes requieren combinaciones distintas de HBM, DRAM, SSD y almacenamiento compartido. El crecimiento de KV cache en la etapa decode se presenta como la principal restricción de memoria, impulsando el interés por nuevos niveles y arquitecturas de memoria.

InstituciónBernstein
Fecha20260828
Sectorglobal memory

Resumen

El informe sostiene que entrenamiento, inferencia, RAG y flujos de trabajo de agentes requieren combinaciones distintas de HBM, DRAM, SSD y almacenamiento compartido. El crecimiento de KV cache en la etapa decode se presenta como la principal restricción de memoria, impulsando el interés por nuevos niveles y arquitecturas de memoria.

La cobertura de múltiples compañías incluye calificaciones Outperform para Samsung Electronics, SK hynix, Micron, SanDisk, Seagate y Western Digital; KIOXIA tiene calificación Underperform.
memoria para IAHBMKV cacheDRAMNANDCXLStorage NextRAGIA de agentes
  • El entrenamiento depende de todos los niveles de memoria, desde HBM hasta DRAM, SSD local y almacenamiento en red.
  • El prefill de inferencia está limitado por cómputo, mientras que decode está limitado por memoria porque la demanda de KV cache aumenta con tokens y usuarios concurrentes.
  • CXL, Storage Next y CMX buscan añadir niveles entre la memoria de sistema convencional, SSD local y almacenamiento compartido.
  • Enfoques emergentes como HBF, zHBM, NVHBM, PIM y memoria de clase almacenamiento buscan resolver compensaciones de capacidad, ancho de banda, latencia o coste.

Interpretación del informe

Visión general

Esta introducción explica dónde encajan las distintas tecnologías de memoria en sistemas de IA. Bernstein estructura el análisis en torno a requisitos específicos de cada carga de trabajo y dos jerarquías complementarias: una arquitectónica basada en la posición dentro del sistema y otra de hardware basada en mecanismos de almacenamiento y empaquetado.

Perspectivas principales

Bernstein comienza con las cargas de trabajo de modelos de lenguaje grandes basados en transformers porque sus requisitos de memoria difieren de forma marcada según la tarea. El entrenamiento es intensivo en cómputo y ancho de banda, por lo que HBM es crítico para el tamaño del modelo y la velocidad de cómputo; pero también necesita capacidad de menor coste para conjuntos de datos, niveles más rápidos para preparar los flujos y almacenamiento de checkpoints, ya que el entrenamiento puede durar meses. Por ello, el informe considera DRAM de sistema, SSD local y almacenamiento en red como complementos necesarios, no sustitutos, de HBM. La inferencia se divide en prefill y decode. Prefill procesa el prompt y genera el primer token; suele estar limitado por cómputo porque las grandes operaciones matriciales mantienen una elevada utilización de GPU, por lo que HBM dentro del acelerador es relativamente importante. Su medida clave de latencia es time to first token (TTFT): el informe cita alrededor de 0.5 segundos o menos como ideal y un segundo como aceptable para chatbots, mientras que más de dos segundos puede frustrar a usuarios, salvo en tareas grandes. Decode genera tokens de forma autorregresiva. Para evitar recálculos, los modelos guardan tokens previos en una KV cache. Los pesos son estáticos y compartibles entre usuarios, pero los datos de KV cache cambian con cada token y difieren entre usuarios, de modo que la necesidad de capacidad aumenta con el número de tokens y usuarios concurrentes. Bernstein describe por ello decode como limitado por memoria y sostiene que KV cache puede superar los pesos del modelo en grandes despliegues, restringiendo ventanas de contexto, concurrencia, escala de despliegue y potencialmente el tamaño de ingresos. Time per output token (TPOT) es la medida clave de decode; el informe cita hasta 50 ms para chat de texto y menos de 10 ms para aplicaciones exigentes de voz en tiempo real, programación y agentes. RAG incorpora un patrón distinto de almacenamiento. Crear una base de datos vectorial a partir de datos no estructurados de gran volumen requiere capacidad considerable de SSD o HDD y DRAM de sistema para construir índices, con uso relativamente menor de HBM; Bernstein describe esta preparación offline como un coste único independiente del número de usuarios y tokens. En la búsqueda, una consulta suele convertirse rápidamente en vector mediante HBM, pero DRAM de sistema normalmente realiza más trabajo de coincidencia cercana que HBM o SSD. El contenido recuperado vuelve después al prefill y decode habituales. Los flujos de trabajo de agentes agravan el problema: los agentes de varios pasos necesitan memoria para planes, bifurcaciones y estados intermedios, añaden demanda de CPU y memoria convencional al usar herramientas externas, y alimentan repetidamente resultados a fases posteriores de inferencia, aumentando la demanda de prefill, decode y KV cache. La jerarquía arquitectónica va desde SRAM en chip de latencia muy baja, pasando por HBM, DRAM de sistema, memoria CXL y Storage Next, hasta SSD local, CMX y almacenamiento compartido SSD/HDD/cinta. HBM se sitúa justo debajo de la memoria en chip porque el empaquetado conjunto con aceleradores proporciona ancho de banda elevado y baja latencia para pesos activos y KV cache. DRAM de sistema ofrece mayor capacidad, pero mayor latencia. CXL busca agrupar memoria físicamente separada y puede extenderse a productos NAND hechos más similares a DRAM mediante caché DRAM o SRAM. Storage Next se presenta como una iniciativa liderada por NVIDIA para orientar la gestión de memoria a GPU y emplear el menor coste y mayor capacidad de NAND, mejorando al mismo tiempo latencia, IOPS y granularidad de acceso; Bernstein la coloca entre DDR DRAM y SSD local. CMX es un nivel compartido basado en SSD optimizado para KV cache entre nodos de cómputo, y la arquitectura de referencia STX de NVIDIA busca facilitar interoperabilidad. El SSD local extiende la capacidad a nivel de nodo, mientras que SSD compartido, HDD y cinta gestionan datos duraderos o menos sensibles a la latencia. La jerarquía de hardware explica las compensaciones técnicas subyacentes. SRAM ofrece la menor latencia, pero requiere más área de silicio que DRAM, por lo que resulta útil para cachés en chip. HBM es DRAM empaquetada junto al XPU, mientras que la DRAM convencional también sirve como memoria de sistema y puede utilizarse en productos CXL. Bernstein destaca el escalado continuo de DRAM mediante nodos de proceso más pequeños, señala la importancia estratégica de EUV y analiza 4F² y 3D DRAM como vías de investigación chinas; 4F² puede aportar un beneficio de densidad puntual, mientras que 3D DRAM podría contar con una trayectoria de escalado más larga, pero es técnicamente más difícil y faltan años para su comercialización. El informe repasa varias innovaciones en HBM y DRAM. zHBM de Samsung coloca pilas de HBM encima del XPU para acortar conexiones, pero Bernstein cuestiona si la DRAM puede soportar el calor del procesador y si los rendimientos y costes del hybrid bonding están listos comercialmente. NVHBM de NVIDIA traslada el diseño del base die a NVIDIA, lo que podría reducir el coste del die XPU, aumentar el área de cómputo, mejorar el ancho de banda y reducir el consumo, pero también estandariza parte de la diferenciación de los proveedores de memoria y podría desplazar valor de fabricación a las fundiciones. XBM y ZAM de Intel, HBC de Qualcomm y formatos de módulo como MRDIMM, SOCAMM2 y LPCAMM2 se presentan como rutas alternativas para mejorar ancho de banda, gestión térmica o consumo. HBC sacrifica parte del rendimiento para reducir el coste de empaquetado al evitar el interposer CoWoS y utiliza LPDDR; Qualcomm apunta a fiscal 2027 para la primera generación y a 2028 para la segunda. En NAND y memoria de clase almacenamiento, Bernstein sitúa los productos NAND mejorados entre DRAM y SSD convencional. Z-NAND y XL-FLASH utilizan SLC o MLC para sacrificar parte de la ventaja de capacidad y coste a cambio de menor latencia y mayor IOPS; el GP-series SSD de KIOXIA se cita con hasta 10M IOPS en 2026 y más de 100M en 2027. El informe asigna XL-FLASH basado en SLC/MLC a aplicaciones tipo Storage Next, TLC a productos CMX que equilibran coste y rendimiento, y QLC a productos de gran capacidad que compiten con HDD. HBF, liderado por SanDisk y SK hynix, busca complementar HBM con el menor coste y mayor capacidad de NAND acercándose al ancho de banda de HBM, pero Bernstein recalca la dificultad técnica de salvar varias capas de hardware. HDD sigue siendo adecuado para datos fríos de bajo coste y acceso poco frecuente; el informe afirma que la creciente demanda de almacenamiento, incluido el desbordamiento de KV cache, lo beneficia, y menciona un crecimiento reportado de las necesidades de cinta ante una oferta insuficiente de NAND y HDD. Por último, PIM combina procesamiento y memoria en el mismo silicio para reducir el movimiento de datos, un cuello de botella clave de la computación. Bernstein reconoce su posible beneficio, pero subraya que la adopción ha sido limitada porque PIM se aparta de la separación establecida entre procesamiento y memoria y requeriría rediseñar ampliamente procesadores, software, redes y la cadena de suministro.

Marco de análisis

Bernstein primero clasifica las cargas de trabajo de IA según si la limitación es cómputo, ancho de banda, capacidad o latencia. Después sitúa los tipos de memoria en una jerarquía arquitectónica basada en su posición y propósito dentro del sistema, seguida de una jerarquía de hardware basada en diseño de celda, empaquetado y mecanismo de almacenamiento. El informe utiliza este marco para explicar las compensaciones entre coste, capacidad, ancho de banda y latencia de tecnologías consolidadas y emergentes.

Notas metodológicas

  • Marco de análisis sectorialTransmisión entre tramos de la cadena de valor

    Jerarquías arquitectónica y de hardware de memoria para IA

    El informe organiza la memoria desde SRAM en chip hasta HBM, DRAM, SSD y almacenamiento compartido para mostrar cómo la demanda de cargas de trabajo recorre la cadena de suministro de memoria para IA.

  • Marco de análisis sectorialMarco de oferta y demanda

    Requisitos de memoria específicos por carga de trabajo

    El análisis distingue entrenamiento, prefill, decode, RAG y flujos de trabajo de agentes para explicar qué recursos de memoria se vuelven limitantes y por qué.

Correspondencia y comparación de activos

Correspondencia estructurada entre la tesis y activos concretos (fortalezas, debilidades, pares y riesgos).

  • Samsung Electronics (005930.KS)
    Proveedor de memoria cubierto y desarrollador de zHBM, módulos de memoria CXL y Z-NAND.
    Fortalezas
    El informe destaca zHBM, la memoria CXL híbrida CMM-H y los productos Z-SSD.
    Comparación
    zHBM busca superar al HBM estándar al colocar pilas de HBM sobre el XPU.
    Riesgos
    Bernstein cuestiona el rendimiento térmico de zHBM y la preparación comercial del rendimiento y coste del hybrid bonding.
  • SK hynix (000660.KS)
    Proveedor de memoria cubierto y participante de HBF.
    Fortalezas
    El informe identifica a SK hynix como líder de HBF junto con SanDisk y como fuente de ejemplos de HBM.
    Comparación
    HBF busca complementar HBM con mayor capacidad basada en NAND y menor coste.
    Riesgos
    HBF debe superar una importante brecha de rendimiento entre NAND y HBM.
  • Micron (MU)
    Proveedor de memoria cubierto y participante de Storage Next.
    Fortalezas
    El informe cita el XTR SSD de Micron como ejemplo de pSLC e incluye a Micron entre los colaboradores de Storage Next.
    Debilidades
    NVHBM puede reducir la diferenciación de los proveedores de memoria en el base die.
    Comparación
    Micron figura junto con Samsung entre los proveedores que fabrican el base die del HBM estándar.
    Riesgos
    La estandarización del base die de NVHBM podría trasladar valor a NVIDIA y a las fundiciones.
  • KIOXIA (285A.T)
    Proveedor cubierto de NAND y SSD; su GP-series SSD se utiliza como ejemplo de Storage Next.
    Fortalezas
    Los GP-series SSD con XL-FLASH se citan por sus IOPS muy elevados y su ubicación en el nivel Storage Next.
    Comparación
    XL-FLASH basado en SLC/MLC prioriza latencia e IOPS frente a la economía de densidad de TLC.
  • SanDisk (SNDK)
    Proveedor cubierto de NAND y líder de HBF.
    Fortalezas
    El informe identifica a SanDisk como líder de HBF y utiliza su diseño HBF para ilustrar una mayor capacidad total de memoria.
    Comparación
    HBF busca complementar, no sustituir, a HBM con NAND de menor coste y mayor capacidad.
    Riesgos
    La mejora de rendimiento requerida para que NAND se acerque al ancho de banda de HBM es un desafío técnico elevado.
  • Seagate (STX)
    Empresa de almacenamiento cubierta vinculada al nivel inferior de almacenamiento compartido.
    Comparación
    HDD se sitúa por debajo de NAND en la jerarquía de memoria, pero sigue siendo útil para almacenamiento en frío de bajo coste.
  • Western Digital (WDC)
    Empresa de almacenamiento cubierta vinculada al nivel inferior de almacenamiento compartido.
    Comparación
    El informe describe HDD como una opción de almacenamiento compartido G4 para datos duraderos y menos sensibles a la latencia.

Datos clave

  • TTFT ideal para chatbots0.5 seconds or lowerEl informe lo cita como ideal para el tiempo hasta el primer token; 1 segundo es aceptable.
  • TTFT potencialmente tolerable para tareas grandesMore than 2 secondsEl informe dice que puede tolerarse en tareas como procesar un PDF de 100 páginas, pero puede frustrar a los usuarios.
  • TPOT para chat de textoUp to 50 msEjemplo de tiempo por token de salida aceptable.
  • TPOT de alta exigenciaLess than 10 msEjemplo de requisito para voz en tiempo real, programación y cargas de trabajo de agentes.
  • IOPS de KIOXIA GP-series SSDUp to 10M in 2026; 100M+ in 2027Citado para almacenamiento de alto IOPS basado en XL-FLASH.
  • Calendario de Qualcomm HBCGen-1 in fiscal 2027; Gen-2 in 2028Objetivo de la empresa citado por el informe.

Impacto e implicaciones

El marco de Bernstein sugiere que la demanda de memoria para IA no se limita a HBM: la ampliación de ventanas de contexto, el uso concurrente, los conjuntos de datos RAG y los flujos de agentes pueden aumentar la demanda de DRAM, SSD, HDD y nuevos niveles intermedios. El informe destaca que el valor tecnológico y comercial de cada solución depende de dónde mejore el cuello de botella de latencia, ancho de banda, capacidad o coste.

Riesgos

  • HBF afronta un elevado obstáculo tecnológico porque NAND debe superar una amplia brecha de rendimiento para complementar HBM.
  • zHBM puede afrontar retos de gestión térmica, rendimiento de hybrid bonding y coste antes de la producción comercial.
  • La adopción de PIM ha sido limitada porque exige cambios importantes en la arquitectura de procesadores, software, redes y cadena de suministro.
  • 3D DRAM es técnicamente difícil y su comercialización puede tardar años.
ICP de Zhejiang n.º 2022035445-5
Aviso legal: los datos de mercado, gráficos, indicadores, opiniones de investigación y demás información de este sitio web se ofrecen exclusivamente para mostrar información, comunicar investigación y servir de referencia educativa. No deben considerarse asesoramiento de inversión personalizado, recomendaciones de valores, instrucciones de negociación, solicitudes ni garantías de rentabilidad. Aunque nos esforzamos por mejorar la fiabilidad de los datos y contenidos, estos pueden sufrir retrasos, errores, omisiones o actualizaciones tardías por diferencias entre fuentes, limitaciones metodológicas, procesamiento del sistema o volatilidad del mercado. Cada usuario debe ejercer su propio criterio según sus circunstancias y asumir todos los riesgos y responsabilidades derivados del uso de este sitio web.

Configuración

Inicia sesión para ver los accesos recientes