Interpretação de relatórios
Cobertura das pesquisas mais recentes dos principais bancos de investimento de Wall Street
Interpretação do relatórioHilo Research

Global AI memory — Interpretação do relatório

A Bernstein explica que treinamento, inferência, RAG e fluxos agênticos criam gargalos de memória distintos e impulsionam uma hierarquia mais ampla de tecnologias de memória para IA. O relatório destaca a inferência intensiva em cache KV como catalisador-chave para inovação em capacidade, largura de banda e memória de menor custo.

InstituiçãoBernstein
Data20260828
SetorAI memory and semiconductor memory

Resumo

A Bernstein explica que treinamento, inferência, RAG e fluxos agênticos criam gargalos de memória distintos e impulsionam uma hierarquia mais ampla de tecnologias de memória para IA. O relatório destaca a inferência intensiva em cache KV como catalisador-chave para inovação em capacidade, largura de banda e memória de menor custo.

Samsung Electronics, SK hynix, Micron, SanDisk, Seagate e Western Digital: Outperform; KIOXIA: Underperform.
Memória de IAHBMDRAMNANDCache KVInferência de IACXLStorage NextHBFSemicondutores
  • O treinamento exige todas as camadas de memória: HBM é crítico para largura de banda, enquanto DRAM, SSD e armazenamento em rede são necessários para conjuntos de dados, preparação e checkpoints.
  • O prefill de inferência é limitado por computação, enquanto a decodificação é limitada por memória porque o cache KV cresce com tokens e usuários concorrentes.
  • O relatório mapeia uma hierarquia arquitetural de SRAM integrada, HBM, memória de sistema, CXL e Storage Next até SSD local, CMX e armazenamento compartilhado.
  • HBF busca combinar capacidade e menor custo do NAND com largura de banda de HBM, mas a Bernstein considera tecnicamente exigente o salto de desempenho necessário.
  • Novas arquiteturas podem redistribuir valor entre fornecedores de memória, projetistas de GPU, fundições, empresas de encapsulamento e fornecedores de armazenamento.

Interpretação do relatório

Visão geral

Este guia constrói um framework para entender as necessidades de memória da IA e as tecnologias que buscam atendê-las. A Bernstein argumenta que a IA não cria um mercado uniforme de memória: a carga de trabalho e a localização dos dados determinam se largura de banda, baixa latência, capacidade, custo ou acesso compartilhado são mais importantes.

Visões principais

A Bernstein parte da premissa de que cargas de trabalho de IA impõem exigências distintas à memória. O treinamento é altamente intensivo em computação e frequentemente limitado por largura de banda, tornando HBM crítico. Contudo, grandes conjuntos de dados devem ser preparados e armazenados em memória mais lenta e barata, e depois mantidos em cache e preparados em camadas mais rápidas antes de serem copiados para HBM. Como o treinamento pode durar meses, são necessários checkpoints para evitar reinício após falhas de hardware ou software. Assim, DRAM de sistema, SSD local e armazenamento em rede são essenciais ao lado de HBM, e não substitutos. Na inferência Transformer, o relatório separa prefill e decodificação. O prefill processa o prompt e gera o primeiro token por meio de grandes operações matriz-matriz; costuma ser limitado por computação, portanto o desempenho do acelerador e HBM importam relativamente mais. A Bernstein identifica TTFT como métrica-chave: cerca de 0.5 segundo ou menos é ideal para chatbots, 1 segundo é aceitável e mais de 2 segundos pode ser tolerável em tarefas grandes, mas tende a causar frustração ou abandono do prompt em muitos casos. A decodificação gera tokens de forma autorregressiva. Para evitar recomputação, tokens anteriores são guardados como pares chave-valor, fazendo a necessidade de cache KV crescer linearmente com a quantidade de tokens. Diferentemente dos pesos estáticos e somente de leitura, o cache KV é atualizado a cada token, é específico de cada usuário e aumenta com os usuários concorrentes. Por isso, a Bernstein classifica a decodificação como limitada por memória: o crescimento combinado de comprimento de contexto e concorrência pode fazer o cache KV superar os pesos do modelo, limitar janelas de contexto e capacidade de usuários e determinar a escala de implantação e de receita de um modelo de IA. TPOT é a métrica relevante; o relatório cita 50ms, ou 20 tokens por segundo, como potencialmente aceitável para chat de texto, versus menos de 10ms para voz em tempo real, programação e usos agênticos exigentes. RAG tem um perfil de armazenamento distinto. A geração de banco de dados processa grandes volumes de documentos, código ou páginas web em bancos vetoriais e índices pesquisáveis. Ela requer grande capacidade de armazenamento, preferencialmente SSD em vez de HDD para reduzir o tempo de acesso, e grandes quantidades de DRAM de sistema para gerar índices, enquanto HBM é relativamente menos importante. Trata-se também de uma carga offline e um custo único, independente de usuários ou tokens. Na busca, a vetorização da consulta pode usar HBM rapidamente, mas encontrar a correspondência mais próxima normalmente torna DRAM de sistema mais importante que HBM ou SSD. Os dados recuperados retornam então ao prefill e à decodificação. Fluxos de trabalho agênticos ampliam essas necessidades por adicionarem planejamento iterativo, ferramentas, ambientes externos e retenção de estados intermediários; também aumentam a demanda por CPU e memória convencional, e os resultados transferidos entre agentes criam repetidamente carga adicional de prefill, decodificação e cache KV. O relatório organiza essas necessidades em uma hierarquia arquitetural de memória. No topo está a memória G0, geralmente SRAM integrada ao acelerador para cálculos imediatos e sensíveis à latência. A HBM G1 fica logo abaixo, encapsulada com o acelerador para fornecer alta largura de banda e baixa latência. A memória de sistema G2 é DRAM de maior capacidade, porém mais lenta, gerenciada por CPU, embora certas GPUs possam acessá-la diretamente. CXL é classificada como G2.5 por combinar logicamente memórias fisicamente separadas em um pool comum e poder se estender a produtos NAND tornados mais semelhantes a DRAM por cache. Storage Next da NVIDIA é tratado como G2.6: iniciativa centrada em GPU que busca unir baixo custo e alta capacidade de NAND com latência, IOPS e granularidade de acesso mais próximos de DRAM, geralmente por híbridos de DRAM/SRAM e NAND. Abaixo disso estão o SSD local G3, que amplia capacidade local mas não é compartilhável entre um pod, e CMX G3.5, camada de armazenamento de contexto da NVIDIA voltada ao cache KV. SSDs compatíveis com CMX ficam em nós de dados e podem ser acessados por vários nós de computação por Ethernet, comutação Spectrum-X e DPUs BlueField-4; GPUs podem acessá-los sem CPU. A Bernstein descreve STX como arquitetura de referência da NVIDIA para integrar armazenamento CMX compatível e soluções ODM. O armazenamento compartilhado G4 consiste em SSD, HDD ou fita para dados duráveis fora do caminho crítico imediato. HDD continua adequado a dados frios de baixo custo e acesso infrequente, beneficiando-se de necessidades crescentes de armazenamento e de transbordamento de cache KV; a demanda por fita também pode crescer se NAND e HDD forem insuficientes. A hierarquia de hardware explica os compromissos de custo, latência e tecnologia. SRAM é mais rápida que DRAM, mas exige mais área de silício; geralmente é integrada a dies lógicos como cache, com L1 mais próxima da computação e de menor capacidade. DRAM embarcada pode competir com SRAM em caches maiores, mas tem participação limitada. HBM é DRAM e compartilha capacidade de wafer com DRAM convencional, que também pode aparecer em memória de sistema e CXL. A Bernstein aponta que a evolução da DRAM continua impulsionada principalmente por escalonamento litográfico e argumenta que EUV é necessária para DRAM avançada; a falta de EUV na China é vista como limitação competitiva de longo prazo para a CXMT. A DRAM 4F² é um ganho pontual de densidade por deslocar circuitos periféricos, enquanto a DRAM 3D pode oferecer uma trajetória mais longa de escalonamento, mas é mais difícil tecnicamente e está a anos da comercialização. Diversas inovações buscam elevar o desempenho de memória, com riscos próprios. A zHBM da Samsung colocaria HBM sobre o acelerador para encurtar conexões, mas a Bernstein questiona se a DRAM suportará o calor do processador e se rendimento e custo da ligação híbrida estão prontos para produção comercial. A NVHBM da NVIDIA move as funções do controlador de memória para um die base desenhado pela NVIDIA, podendo reduzir custo do acelerador ou liberar área para computação e melhorar largura de banda e consumo de energia. Contudo, a Bernstein argumenta que isso padroniza parte da diferenciação de die base dos fornecedores de memória e transfere valor de fabricação para fundições, provavelmente TSMC. A XBM da Intel é apresentada como conceito emergente de DRAM de back-end que pode coexistir com lógica e potencialmente servir a processamento em memória, mas sua compatibilidade de fabricação e o produtor futuro são incertos. A ZAM da Intel reorienta dies DRAM para melhorar dissipação térmica; a meta declarada de uso prático é FY2029, e a transmissão sem fio entre dies reorientados é um desafio. A HBC da Qualcomm aceita desempenho menor que HBM para evitar custos de CoWoS e interposer, usa LPDDR para menor consumo e mira primeira geração no ano fiscal de 2027 e segunda em 2028. Inovações de módulos, como MRDIMM, SOCAMM2 e LPCAMM2, buscam elevar o desempenho da memória de sistema. MRDIMM adiciona chips de interface para maior largura de banda. SOCAMM2 usa LPDDR, barramento de dados de 128-bit e perfil menor para reduzir consumo, elevar largura de banda por módulo e melhorar o fluxo de ar em servidores de IA. PIM combina lógica e memória para reduzir o tráfego de dados, gargalo central dos computadores, mas a Bernstein destaca que a adoção é limitada porque a abordagem difere da separação predominante entre processamento e memória e exige mudanças em processadores, software, redes e na cadeia de suprimentos de lógica e memória. Para memória de classe de armazenamento, a Bernstein posiciona as tecnologias entre DRAM e NAND. MRAM, PCM e RRAM usam mecanismos fundamentalmente distintos de DRAM e NAND, enquanto abordagens NAND aprimoradas buscam mais IOPS, menor latência e granularidade de acesso mais fina por cache ou compromissos de modo de célula. A XL-FLASH da KIOXIA usa SLC e depois MLC para suportar SSDs GP de alto IOPS; o relatório cita até 10M IOPS neste ano e 100M+ em 2027. Z-NAND/Z-SSD da Samsung também mira latência ultrabaixa. A Bernstein associa produtos SLC/MLC a aplicações tipo Storage Next, TLC a produtos CMX que equilibram desempenho e custo, e QLC a produtos de grande capacidade que concorrem com HDD. O XTR SSD da Micron é citado como exemplo de pSLC, usando apenas parte das células capazes de TLC para armazenar 1 bit e obter resistência e velocidade semelhantes às de SLC. HBF, liderada por SanDisk e SK hynix, é a principal tentativa baseada em NAND de complementar HBM: busca largura de banda semelhante à de HBM com maior capacidade e menor custo por bit e é posicionada conceitualmente como camada G1.5. O relatório enfatiza que isso exige que NAND salte vários níveis da hierarquia de hardware, criando elevada barreira tecnológica. A zNAND-O da Samsung é posicionada para IA no dispositivo, usa TLC para grande capacidade e é encapsulada perto do processador. Em conjunto, o framework da Bernstein implica que o crescimento da IA amplia o mercado endereçável de toda a pilha de memória e armazenamento, mas o benefício econômico varia conforme a carga de trabalho, a camada, a viabilidade de execução e quem captura valor na integração tecnológica.

Estrutura de análise

A Bernstein primeiro relaciona cada carga de trabalho principal de IA a seu gargalo de desempenho e às necessidades de memória, e depois a posiciona em uma hierarquia arquitetural, conforme a localização da memória no sistema, e em uma hierarquia de hardware, conforme a estrutura de célula e o mecanismo de armazenamento. O relatório compara latência, largura de banda, capacidade, custo, encapsulamento e efeitos na cadeia de suprimentos.

Notas metodológicas

  • Marco de análise setorialTransmissão entre elos da cadeia de valor

    Mapeamento de cargas de trabalho de IA para camadas de memória

    O relatório acompanha como a demanda das cargas de trabalho se transmite para aceleradores, DRAM, NAND, SSD, armazenamento, encapsulamento e fornecedores, mostrando por que partes distintas da cadeia de memória podem se beneficiar ou enfrentar pressão.

  • Marco de análise setorialAnálise da curva de custos

    Compromisso entre desempenho, capacidade e custo das memórias

    O relatório compara memória rápida e de alto custo com alternativas de menor custo e maior capacidade para explicar a lógica de HBF, CXL, Storage Next e produtos de memória de classe de armazenamento.

Mapeamento e comparação de ativos

Mapeamento estruturado da tese para ativos nomeados (pontos fortes, pontos fracos, pares e riscos).

  • Samsung Electronics (005930.KS)
    Fornecedor de memória coberto; o relatório discute produtos zHBM, Z-NAND e memória CXL.
    Pontos fortes
    Desenvolve ofertas de zHBM, CMM-H e Z-NAND/Z-SSD em camadas emergentes de memória para IA.
    Pontos fracos
    A Bernstein questiona a gestão térmica do zHBM e a prontidão de rendimento e custo da ligação híbrida.
    Comparação
    Compete com outros fornecedores de HBM e DRAM; NVHBM pode reduzir a diferenciação do die base.
    Riscos
    Prontidão comercial do zHBM e requisitos de escalonamento tecnológico.
  • SK hynix (000660.KS)
    Fornecedor de memória coberto e co-líder em HBF.
    Pontos fortes
    Participa em HBM e lidera HBF com a SanDisk.
    Comparação
    HBF busca complementar HBM com NAND de maior capacidade e menor custo.
    Riscos
    HBF exige um salto substancial de desempenho do NAND.
  • Micron (MU)
    Fornecedor de memória coberto; citado pela tecnologia de SSD XTR baseado em pSLC e por módulos DRAM.
    Pontos fortes
    Participa de abordagens avançadas de DRAM e SSD baseadas em NAND.
    Comparação
    Compete com Samsung e SK hynix em memória para IA; NVHBM pode padronizar a diferenciação do die base.
    Riscos
    NVHBM pode transferir valor dos fornecedores de memória para a NVIDIA e as fundições.
  • KIOXIA (285A.JP)
    Fornecedor de NAND e SSD coberto; seu SSD da série GP ilustra Storage Next e XL-FLASH.
    Pontos fortes
    XL-FLASH apoia produtos SSD de alto IOPS para usos de memória de classe de armazenamento.
    Comparação
    Sua abordagem baseada em SLC/MLC mira camadas mais rápidas, enquanto TLC e QLC atendem respectivamente CMX e armazenamento orientado à capacidade.
    Riscos
    A economia do produto requer compromissos entre capacidade, custo e modos de célula de maior desempenho.
  • SanDisk (SNDK)
    Fornecedor de armazenamento coberto e co-líder em HBF.
    Pontos fortes
    Lidera HBF com a SK hynix, visando capacidade maior e custo por bit menor que HBM.
    Comparação
    HBF fica entre HBM e o armazenamento NAND de níveis inferiores.
    Riscos
    O relatório identifica uma barreira tecnológica elevada para alcançar desempenho suficiente de HBF.
  • Seagate (STX)
    Fornecedor de armazenamento coberto ligado à demanda por armazenamento compartilhado.
    Pontos fortes
    HDD continua sendo opção de baixo custo para dados frios e pode se beneficiar do transbordamento de cache KV.
    Pontos fracos
    HDD está fora do caminho crítico imediato e é muito mais lento que memória flash.
    Comparação
    Compete com SSDs de alta capacidade e fita no armazenamento compartilhado G4.
    Riscos
    Seu papel depende da demanda por capacidade de baixo custo, e não de cargas sensíveis à latência.
  • Western Digital (WDC)
    Fornecedor de armazenamento coberto ligado à demanda por SSD e armazenamento compartilhado.
    Pontos fortes
    Tem exposição à expansão da demanda de armazenamento de dados de IA em flash e em camadas de armazenamento.
    Comparação
    As tecnologias de armazenamento se diferenciam por latência, IOPS, durabilidade, capacidade e custo.

Dados principais

  • TTFT ideal para chatbot0.5 second or lowerA Bernstein cita este como o tempo ideal até o primeiro token.
  • TTFT aceitável para chatbot1 secondTTFT acima de 2 segundos pode levar à frustração do usuário ou abandono do prompt.
  • TPOT para chat de texto50ms, or 20 tokens per secondVelocidade de saída potencialmente aceitável para chat de texto.
  • TPOT para usos de alta exigênciaLess than 10msRelevante para voz em tempo real, programação e cargas agênticas.
  • Desempenho do SSD da série GP da KIOXIAUp to 10M IOPS this year and 100M+ in 2027Citado para o posicionamento de memória de classe de armazenamento de alto IOPS baseado em XL-FLASH.
  • Roteiro da Qualcomm HBCGen-1 in fiscal 2027; Gen-2 in 2028Alternativa baseada em LPDDR que sacrifica desempenho em troca de menor custo.
  • Meta da Intel ZAMFY2029Meta declarada de uso prático do conceito de encapsulamento DRAM voltado à gestão térmica.

Impacto e implicações

O relatório indica que a demanda por infraestrutura de IA vai além de HBM: cache KV na decodificação, bancos de dados RAG e fluxos agênticos criam papéis para DRAM, SSD, HDD, fita, pooling de memória e novas camadas intermediárias. Também sugere que escolhas de arquitetura e integração podem redistribuir valor entre fabricantes de memória, projetistas de GPU, fundições, fornecedores de encapsulamento e fornecedores de armazenamento.

Riscos

  • HBF enfrenta alta barreira tecnológica porque NAND precisa alcançar grande salto de desempenho para complementar HBM.
  • zHBM pode enfrentar desafios térmicos e de rendimento e custo da ligação híbrida antes da produção comercial.
  • A adoção de PIM continua limitada porque exige mudanças amplas em processadores, software, redes e cadeias de suprimentos.
  • A DRAM 3D é tecnologicamente mais difícil e ainda está a anos da comercialização.
  • NVHBM pode reduzir a diferenciação e o valor capturado pelos projetos de die base dos fornecedores de memória.

Pontos a observar

  • O crescimento do cache KV em relação aos pesos do modelo à medida que aumentam janelas de contexto e usuários concorrentes.
  • Se a capacidade de HBM pode crescer a custo acessível ou se as cargas migram para DRAM, NAND e novas camadas intermediárias.
  • O progresso de CXL, Storage Next, CMX e implementações de armazenamento direto por GPU.
  • A execução comercial de HBF, zHBM, NVHBM, XBM, ZAM e HBC.
  • A adoção de tecnologias NAND de alto IOPS, como XL-FLASH, Z-NAND e produtos pSLC.
ICP de Zhejiang nº 2022035445-5
Aviso: os dados de mercado, gráficos, indicadores, opiniões de pesquisa e outras informações deste site destinam-se exclusivamente à exibição de informações, comunicação de pesquisa e referência educacional. Não devem ser considerados aconselhamento de investimento personalizado, recomendação de valores mobiliários, instrução de negociação, solicitação ou garantia de retorno. Embora busquemos melhorar a confiabilidade dos dados e do conteúdo, podem ocorrer atrasos, erros, lacunas ou atualizações tardias devido a diferenças entre fontes, limitações metodológicas, processamento do sistema ou volatilidade do mercado. Cada usuário deve exercer julgamento independente de acordo com suas circunstâncias e assumir todos os riscos e responsabilidades decorrentes do uso deste site.

Configurações

Entre para ver os logins recentes