Interpretação de relatórios
Cobertura das pesquisas mais recentes dos principais bancos de investimento de Wall Street
Interpretação do relatórioHilo Research

Global AI memory — Interpretação do relatório

O relatório argumenta que treinamento, inferência, RAG e fluxos de agentes exigem combinações distintas de HBM, DRAM, SSD e armazenamento compartilhado. O crescimento de KV cache em decode é apresentado como a principal restrição de memória, impulsionando interesse por novos níveis e arquiteturas.

InstituiçãoBernstein
Data20260828
Setorglobal memory

Resumo

O relatório argumenta que treinamento, inferência, RAG e fluxos de agentes exigem combinações distintas de HBM, DRAM, SSD e armazenamento compartilhado. O crescimento de KV cache em decode é apresentado como a principal restrição de memória, impulsionando interesse por novos níveis e arquiteturas.

A cobertura de múltiplas empresas inclui ratings Outperform para Samsung Electronics, SK hynix, Micron, SanDisk, Seagate e Western Digital; KIOXIA tem rating Underperform.
memória para IAHBMKV cacheDRAMNANDCXLStorage NextRAGIA de agentes
  • O treinamento depende de todos os níveis de memória, de HBM a DRAM, SSD local e armazenamento em rede.
  • O prefill de inferência é limitado por computação, enquanto decode é limitado por memória, pois KV cache cresce com tokens e usuários simultâneos.
  • CXL, Storage Next e CMX buscam adicionar níveis entre memória de sistema convencional, SSD local e armazenamento compartilhado.
  • HBF, zHBM, NVHBM, PIM e storage-class memory buscam resolver trade-offs de capacidade, largura de banda, latência ou custo.

Interpretação do relatório

Visão geral

Este guia explica onde diferentes tecnologias de memória se encaixam em sistemas de IA. A Bernstein estrutura a discussão em torno de requisitos por carga de trabalho e de duas hierarquias complementares: arquitetural, por posição no sistema, e de hardware, por mecanismo de armazenamento e empacotamento.

Visões principais

A Bernstein começa pelas cargas de trabalho de grandes modelos de linguagem baseados em transformer, pois os requisitos de memória variam muito conforme a tarefa. O treinamento é intensivo em computação e largura de banda, tornando HBM crítico para o tamanho do modelo e a velocidade de computação, mas também exige capacidade de menor custo para datasets, níveis mais rápidos para staging de pipelines e armazenamento de checkpoints, já que o treinamento pode durar meses. Assim, DRAM de sistema, SSD local e armazenamento em rede são complementos necessários, não substitutos, de HBM. A inferência se divide em prefill e decode. Prefill processa o prompt e gera o primeiro token; costuma ser limitado por computação, pois grandes operações matriciais mantêm a GPU altamente utilizada, tornando HBM dentro do acelerador relativamente importante. A principal métrica é time to first token (TTFT): cerca de 0.5 segundos ou menos é ideal e um segundo é aceitável para chatbots, enquanto mais de dois segundos pode frustrar usuários, salvo em tarefas grandes. Decode gera tokens de forma autorregressiva. Para evitar recomputação, os modelos guardam tokens anteriores em KV cache. Pesos são estáticos e compartilháveis, mas os dados de KV cache mudam a cada token e diferem por usuário; a necessidade cresce com o número de tokens e usuários simultâneos. Por isso, a Bernstein classifica decode como limitado por memória e afirma que KV cache pode superar os pesos do modelo em grandes implementações, restringindo janela de contexto, concorrência, escala de implementação e potencialmente receita. A métrica é time per output token (TPOT): até 50 ms para chat de texto e menos de 10 ms para voz em tempo real, programação e aplicações de agentes. RAG tem outro padrão de armazenamento. A criação de banco de dados vetorial requer grande capacidade de SSD ou HDD e DRAM de sistema para índices, com uso relativamente menor de HBM; a Bernstein a caracteriza como custo offline único, independente de usuários e tokens. Na busca, HBM normalmente converte rapidamente a consulta em vetor, mas DRAM de sistema faz mais da busca por correspondências do que HBM ou SSD. O conteúdo recuperado retorna ao prefill e decode. Fluxos de agentes elevam a pressão: precisam de memória para planos, ramificações e estados intermediários, aumentam a demanda por CPU e memória convencional ao usar ferramentas externas e realimentam resultados em inferências subsequentes, ampliando a demanda por prefill, decode e KV cache. A hierarquia arquitetural vai de SRAM on-chip de latência muito baixa a HBM, DRAM de sistema, memória CXL e Storage Next, depois SSD local, CMX e armazenamento compartilhado em SSD/HDD/fita. HBM fica logo abaixo da memória on-chip porque o empacotamento conjunto com aceleradores oferece alta largura de banda e baixa latência para pesos ativos e KV cache. DRAM de sistema tem mais capacidade, mas maior latência. CXL visa agrupar memória fisicamente separada e pode abranger NAND tornada mais parecida com DRAM via cache DRAM ou SRAM. Storage Next é apresentado como iniciativa liderada pela NVIDIA para tornar a gestão de memória mais orientada por GPU e usar menor custo e maior capacidade de NAND, com menor latência, maior IOPS e granularidade de acesso; a Bernstein o coloca entre DDR DRAM e SSD local. CMX é uma camada SSD compartilhada e otimizada para KV cache entre nós de computação, e a arquitetura STX busca interoperabilidade. SSD local amplia a capacidade do nó; SSD compartilhado, HDD e fita servem dados duráveis ou menos sensíveis à latência. A hierarquia de hardware explica os trade-offs técnicos. SRAM tem a menor latência, mas usa mais área de silício que DRAM, sendo útil para caches on-chip. HBM é DRAM empacotada ao lado do XPU; DRAM convencional também serve como memória de sistema e pode ser usada em CXL. A Bernstein destaca o escalonamento contínuo de DRAM por nós menores, a importância estratégica de EUV e 4F² e 3D DRAM como rotas de pesquisa chinesas. 4F² pode oferecer um benefício único de densidade; 3D DRAM pode ter uma trajetória mais longa, mas é mais difícil tecnicamente e sua comercialização está a anos de distância. O relatório analisa zHBM, NVHBM, XBM, ZAM, HBC, MRDIMM, SOCAMM2 e LPCAMM2. zHBM da Samsung coloca HBM sobre o XPU, mas a Bernstein questiona resistência térmica, rendimento e custo do hybrid bonding. NVHBM desloca o desenho do base die para a NVIDIA, podendo reduzir custo do die XPU, ampliar área de computação, aumentar largura de banda e reduzir consumo, porém padroniza parte da diferenciação dos fornecedores de memória e pode deslocar valor de fabricação para foundries. HBC sacrifica algum desempenho para evitar o interposer CoWoS e usa LPDDR; a Qualcomm visa fiscal 2027 para a geração um e 2028 para a geração dois. Em NAND e storage-class memory, Z-NAND e XL-FLASH usam SLC ou MLC para trocar parte da vantagem de capacidade e custo por menor latência e maior IOPS; o GP-series SSD da KIOXIA é citado com até 10M IOPS em 2026 e 100M+ em 2027. XL-FLASH baseado em SLC/MLC é destinado a Storage Next, TLC a CMX e QLC a produtos de alta capacidade que concorrem com HDD. HBF, liderado por SanDisk e SK hynix, busca complementar HBM com NAND de menor custo e maior capacidade, mas enfrenta grande desafio técnico. HDD continua adequado para dados frios de baixo custo e acesso infrequente, beneficiando-se da demanda por armazenamento e por overflow de KV cache; o relatório também menciona crescimento da demanda por fita diante da insuficiência de NAND e HDD. Por fim, PIM reúne processamento e memória no mesmo silício para reduzir o movimento de dados. A Bernstein reconhece o benefício potencial, mas ressalta que sua adoção foi limitada porque exige grande redesenho de processadores, software, redes e cadeia de suprimentos.

Estrutura de análise

A Bernstein primeiro classifica as cargas de trabalho de IA conforme a restrição seja computação, largura de banda, capacidade ou latência. Em seguida, posiciona os tipos de memória em uma hierarquia arquitetural, baseada em posição e finalidade no sistema, e em uma hierarquia de hardware, baseada em célula, empacotamento e mecanismo de armazenamento. O relatório usa esse arcabouço para explicar os trade-offs entre custo, capacidade, largura de banda e latência.

Notas metodológicas

  • Marco de análise setorialTransmissão entre elos da cadeia de valor

    Hierarquias arquitetural e de hardware da memória para IA

    O relatório organiza a memória de SRAM on-chip até HBM, DRAM, SSD e armazenamento compartilhado para mostrar como a demanda de cargas de trabalho percorre a cadeia de suprimentos de memória para IA.

  • Marco de análise setorialMarco de oferta e demanda

    Requisitos de memória específicos por carga de trabalho

    A análise distingue treinamento, prefill, decode, RAG e fluxos de agentes para explicar quais recursos de memória se tornam limitantes e por quê.

Mapeamento e comparação de ativos

Mapeamento estruturado da tese para ativos nomeados (pontos fortes, pontos fracos, pares e riscos).

  • Samsung Electronics (005930.KS)
    Fornecedor de memória coberto e desenvolvedor de zHBM, módulos de memória CXL e Z-NAND.
    Pontos fortes
    O relatório destaca zHBM, memória CXL híbrida CMM-H e produtos Z-SSD.
    Comparação
    zHBM busca superar o HBM padrão ao colocar pilhas de HBM sobre o XPU.
    Riscos
    A Bernstein questiona o desempenho térmico do zHBM e a maturidade comercial de rendimento e custo do hybrid bonding.
  • SK hynix (000660.KS)
    Fornecedor de memória coberto e participante de HBF.
    Pontos fortes
    O relatório identifica a SK hynix como líder de HBF junto da SanDisk e como fonte de exemplos de HBM.
    Comparação
    HBF busca complementar HBM com maior capacidade baseada em NAND e menor custo.
    Riscos
    HBF precisa superar uma grande lacuna de desempenho entre NAND e HBM.
  • Micron (MU)
    Fornecedor de memória coberto e participante de Storage Next.
    Pontos fortes
    O relatório cita o XTR SSD da Micron como exemplo de pSLC e inclui a Micron entre os colaboradores de Storage Next.
    Pontos fracos
    NVHBM pode reduzir a diferenciação dos fornecedores de memória no base die.
    Comparação
    A Micron é listada com a Samsung entre os fornecedores que fabricam o base die no HBM padrão.
    Riscos
    A padronização do base die de NVHBM pode transferir valor para a NVIDIA e para as foundries.
  • KIOXIA (285A.T)
    Fornecedor coberto de NAND e SSD; seu GP-series SSD é usado como exemplo de Storage Next.
    Pontos fortes
    Os GP-series SSD com XL-FLASH são citados por IOPS muito altos e por sua posição no nível Storage Next.
    Comparação
    XL-FLASH baseado em SLC/MLC prioriza latência e IOPS em detrimento da economia de densidade do TLC.
  • SanDisk (SNDK)
    Fornecedor coberto de NAND e líder de HBF.
    Pontos fortes
    O relatório identifica a SanDisk como líder de HBF e usa seu desenho HBF para ilustrar maior capacidade total de memória.
    Comparação
    HBF busca complementar, e não substituir, HBM com NAND de menor custo e maior capacidade.
    Riscos
    A melhoria de desempenho necessária para aproximar NAND da largura de banda de HBM é um elevado desafio técnico.
  • Seagate (STX)
    Empresa de armazenamento coberta ligada ao nível inferior de armazenamento compartilhado.
    Comparação
    HDD fica abaixo de NAND na hierarquia de memória, mas continua útil para armazenamento frio de baixo custo.
  • Western Digital (WDC)
    Empresa de armazenamento coberta ligada ao nível inferior de armazenamento compartilhado.
    Comparação
    O relatório descreve HDD como uma opção de armazenamento compartilhado G4 para dados duráveis e menos sensíveis à latência.

Dados principais

  • TTFT ideal para chatbots0.5 seconds or lowerO relatório cita isto como ideal para time to first token; 1 segundo é aceitável.
  • TTFT potencialmente tolerável para tarefas grandesMore than 2 secondsO relatório diz que pode ser tolerável em tarefas como analisar um PDF de 100 páginas, mas pode frustrar usuários.
  • TPOT para chat de textoUp to 50 msExemplo de time per output token aceitável.
  • TPOT para alta exigênciaLess than 10 msExemplo de requisito para voz em tempo real, programação e cargas de trabalho de agentes.
  • IOPS do KIOXIA GP-series SSDUp to 10M in 2026; 100M+ in 2027Citado para armazenamento de alto IOPS baseado em XL-FLASH.
  • Cronograma do Qualcomm HBCGen-1 in fiscal 2027; Gen-2 in 2028Meta da empresa citada pelo relatório.

Impacto e implicações

O arcabouço da Bernstein sugere que a demanda de memória para IA não se limita a HBM: janelas de contexto maiores, uso simultâneo, datasets RAG e fluxos de agentes podem elevar a demanda por DRAM, SSD, HDD e novos níveis intermediários. O relatório enfatiza que o valor tecnológico e comercial de cada solução depende de onde ela melhora o gargalo de latência, largura de banda, capacidade ou custo.

Riscos

  • HBF enfrenta um alto obstáculo tecnológico porque NAND precisa superar uma grande lacuna de desempenho para complementar HBM.
  • zHBM pode enfrentar desafios térmicos, de rendimento do hybrid bonding e de custo antes da produção comercial.
  • A adoção de PIM foi limitada porque exige mudanças importantes em arquitetura de processadores, software, redes e cadeia de suprimentos.
  • 3D DRAM é tecnicamente desafiadora e pode estar a anos da comercialização.
ICP de Zhejiang nº 2022035445-5
Aviso: os dados de mercado, gráficos, indicadores, opiniões de pesquisa e outras informações deste site destinam-se exclusivamente à exibição de informações, comunicação de pesquisa e referência educacional. Não devem ser considerados aconselhamento de investimento personalizado, recomendação de valores mobiliários, instrução de negociação, solicitação ou garantia de retorno. Embora busquemos melhorar a confiabilidade dos dados e do conteúdo, podem ocorrer atrasos, erros, lacunas ou atualizações tardias devido a diferenças entre fontes, limitações metodológicas, processamento do sistema ou volatilidade do mercado. Cada usuário deve exercer julgamento independente de acordo com suas circunstâncias e assumir todos os riscos e responsabilidades decorrentes do uso deste site.

Configurações

Entre para ver os logins recentes