US semiconductor AI infrastructure: UBS vê a infraestrutura de IA migrando da expansão centrada em aceleradores para a otimização em nível de sistema
As conclusões do AI Infrastructure Summit apontam para demanda persistente por inferência, agravamento dos gargalos de memória e maior importância de redes, flexibilidade de hardware e ciclos de implantação mais rápidos. A UBS também considera subestimada a capacidade de sistema da NVIDIA.
Resumo
As conclusões do AI Infrastructure Summit apontam para demanda persistente por inferência, agravamento dos gargalos de memória e maior importância de redes, flexibilidade de hardware e ciclos de implantação mais rápidos. A UBS também considera subestimada a capacidade de sistema da NVIDIA.
- Operadores de inferência precisam equilibrar baixo custo por token com flexibilidade de hardware para futuras cargas de trabalho.
- Largura de banda e capacidade de memória, além de armazenamento, limitam cada vez mais a utilização dos aceleradores.
- Redes se tornam centrais para inferência distribuída e sensível à latência e podem sustentar vários protocolos concorrentes.
- CXL pode estender a vida útil do DDR4 e reduzir a dependência de DDR5 mais caro.
- A AWS afirmou que uma nova abordagem de implantação pode reduzir o período de ramp-up de racks de cerca de nove meses para algumas semanas.
Interpretação do relatório
Visão geral
A UBS resume os debates do AI Infrastructure Summit de 2026 e argumenta que a expansão de IA é cada vez mais determinada pela economia do sistema inteiro, e não apenas pela capacidade de computação. O relatório destaca demanda persistente por inferência, restrições de memória e rede, abordagens concorrentes de interconexão, configurações de memória habilitadas por CXL e ciclos mais rápidos de desenvolvimento e implantação de chips.
Visões principais
A UBS saiu do evento com três conclusões gerais: a flexibilidade e a expertise de sistema da NVIDIA parecem subestimadas diante do foco do mercado em arquiteturas individuais de computação; a memória continua sendo o maior gargalo e não está melhorando; e ferramentas de IA estão acelerando os ciclos de projeto de computação e ajudando hyperscalers a implantar soluções ASIC mais rapidamente. Ainda não está claro se isso acelerará os prazos para internalização desses ASICs pelos hyperscalers. A demanda por inferência continua muito forte, mas os operadores enfrentam um problema de otimização mais complexo. Eles precisam reduzir o custo por token da geração atual de modelos e preservar fungibilidade de hardware suficiente para cargas de trabalho que podem ser bem diferentes em alguns anos. A UBS vê essa tensão entre otimização e flexibilidade como cada vez mais importante para o desenho da infraestrutura de IA. Soluções emergentes de Cerebras, SambaNova e Etched também ganharam destaque. A otimização está migrando para o nível de sistema. Largura de banda e capacidade de memória, além de armazenamento, são gargalos crescentes; acrescentar mais aceleradores tem pouco valor se o restante do sistema não consegue mantê-los suficientemente utilizados. A "parede de memória" foi um tema recorrente, com soluções que incluem maior throughput de rede scale-up, menor latência e novas arquiteturas de computação. As redes estão se tornando quase tão importantes quanto a computação para inferência distribuída e sensível à latência, pois determinam a eficiência da movimentação de dados entre aceleradores e memória. Redes melhores elevam a utilização de aceleradores e reduzem o custo por token. A UBS ouviu que hyperscalers querem múltiplas alternativas e protocolos, tornando o mercado scale-up menos uma oportunidade de vencedor único. ESUN foi visto como uma alternativa scale-up crível após resolver muitos problemas históricos de latência do Ethernet com um cabeçalho mais curto, preservando benefícios de ecossistema e confiabilidade. NVLink é visto como a opção não Ethernet mais madura e confiável, enquanto UALink é uma alternativa emergente. O Google continua usando amplamente soluções OCS no GCP, mas também avalia UALink para determinadas cargas de inferência sensíveis à latência; a UBS entende que as implantações iniciais seriam menores e específicas. CXL está surgindo como forma de estender a vida útil do DDR4 em sistemas com CPUs recentes projetadas para DDR5. A Meta destacou que 43% dos servidores são limitados por memória e que 69% da pegada de carbono está relacionada a DIMMs de memória. Como o ciclo de vida típico de um DIMM é pelo menos 2x mais longo que o da CPU, DDR4 conectado por CXL pode reduzir a quantidade necessária de DDR5 mais caro. Embora CXL introduza latência adicional versus DIMMs locais, discutiu-se que uma alocação menor, como ~1/4 da memória do sistema proveniente de DDR4 conectado por CXL, pode oferecer desempenho comparável ao ocultar efetivamente a latência. A UBS considera este mais um exemplo de operadores otimizando a infraestrutura de IA pela economia total do sistema, e não por um único componente. A IA também está comprimindo os ciclos de desenvolvimento e implantação de chips. Ferramentas de IA permitem paralelizar partes do projeto de chips antes sequenciais, encurtando prazos, mas também pressionam a implantação de novas gerações. A AWS descreveu uma abordagem em que implanta e testa racks antes da disponibilidade do silício de computação e insere o chip como etapa praticamente final. A AWS disse que isso pode reduzir o ramp-up tradicional de ~9 months para algumas semanas. Para a UBS, este é um efeito de segunda ordem de roadmaps de chips de IA mais rápidos: toda a pilha de infraestrutura precisa estar pronta para uma cadência de produto muito mais rápida.
Estrutura de análise
A UBS baseia suas conclusões em discussões e apresentações no AI Infrastructure Summit, organizando os achados em torno da economia da inferência, gargalos de sistema, alternativas de rede, arquitetura de memória e implantação mais rápida de chips. Ela interpreta observações técnicas pelos efeitos sobre utilização de aceleradores, latência, custo por token, flexibilidade de hardware e economia total do sistema.
Notas metodológicas
Valuation por P/E
A UBS declara usar P/E entre as técnicas de valuation para as empresas discutidas no relatório.
Valuation por EV/FCF
A UBS declara também usar EV/FCF, que compara valor da empresa com fluxo de caixa livre, para avaliar as empresas discutidas no relatório.
Mapeamento e comparação de ativos
Mapeamento estruturado da tese para ativos nomeados (pontos fortes, pontos fracos, pares e riscos).
- NVIDIA (NVDA)A UBS considera que sua flexibilidade e expertise de sistema estão subestimadas diante do foco em arquiteturas individuais de computação.
- Pontos fortes
- Flexibilidade e expertise de sistema.
- Comparação
- NVLink é visto como a opção de rede não Ethernet mais madura e confiável; as alternativas incluem abordagens baseadas em Ethernet e UALink.
- Cerebras, SambaNova, EtchedSoluções emergentes de computação que recebem maior atenção no ecossistema de infraestrutura de IA.
- Comparação
- Posicionadas entre as alternativas a arquiteturas de computação estabelecidas.
- ESUNDescrita como uma alternativa crível de rede scale-up.
- Pontos fortes
- Um cabeçalho mais curto teria resolvido problemas históricos de latência do Ethernet, preservando seus benefícios de ecossistema e confiabilidade.
- Comparação
- Compete com NVLink e UALink emergente em um mercado que a UBS vê como menos propenso a vencedor único.
- UALinkAlternativa emergente de rede avaliada para determinadas cargas de inferência sensíveis à latência.
- Pontos fortes
- Possível adequação para determinadas cargas de trabalho sensíveis à latência.
- Pontos fracos
- As implantações iniciais devem ser menores e específicas para aplicações.
- Comparação
- Contrasta com a posição madura não Ethernet da NVLink e o amplo uso de OCS no GCP.
Dados principais
- Participação no AI Infra Summit~8,000 expertsMais que dobrou em relação à escala do ano anterior.
- Servidores limitados por memória43%Número destacado pela Meta.
- Parcela da pegada de carbono relacionada a DIMMs de memória69%Número destacado pela Meta.
- Ciclo de vida de DIMM versus CPUAt least 2x longerCiclo de vida típico de DIMM em relação ao da CPU.
- Alocação de DDR4 conectado por CXL~1/4 of system memoryAlocação menor discutida como capaz de entregar desempenho comparável ao ocultar a latência incremental.
- Período de ramp-up de racks da AWS~9 months to several weeksRedução descrita pela AWS por meio de implantação e teste prévio de racks antes da disponibilidade do silício de computação.
Impacto e implicações
A UBS argumenta que a oportunidade de infraestrutura de IA é cada vez mais moldada pela capacidade de otimizar sistemas completos: computação, memória, armazenamento e redes precisam trabalhar juntos para elevar a utilização e reduzir o custo por token. Isso reforça a relevância de arquiteturas flexíveis, protocolos de rede diversos, abordagens de extensão de memória e processos de implantação compatíveis com roadmaps de chips mais rápidos.
Riscos
- Uma desaceleração macroeconômica pode afetar as empresas discutidas.
- Uma disrupção do comércio internacional pode afetar as empresas discutidas.
- Disrupção tecnológica por novas invenções pode alterar resultados competitivos.
- Inovação de modelo de negócios e mudanças estruturais na indústria podem afetar vendas unitárias, ASPs e receitas.
Pontos a observar
- Se ciclos mais rápidos de projeto e ramp-up de ASIC aceleram os prazos para hyperscalers internalizarem soluções ASIC.
- A adoção de múltiplos protocolos de rede scale-up, incluindo UALink para cargas de inferência sensíveis à latência.
- O grau de implantação de DDR4 conectado por CXL para reduzir requisitos de DDR5 preservando desempenho.
- Se processos de implantação de infraestrutura conseguem acompanhar roadmaps de chips de IA mais rápidos.