Semicondutores: NVIDIA avança Rubin Ultra e escalabilidade multi-rack; comercialização do Kyber pode atrasar
Vera Rubin Strata entrou em produção no fim de julho, mas os chips, HBM e soluções de rack do Rubin Ultra permanecem em iteração; a NVIDIA pode primeiro usar múltiplos racks Oberon no 2S 2027 para atender à crescente demanda por computação.
Resumo
Vera Rubin Strata entrou em produção no fim de julho, mas os chips, HBM e soluções de rack do Rubin Ultra permanecem em iteração; a NVIDIA pode primeiro usar múltiplos racks Oberon no 2S 2027 para atender à crescente demanda por computação.
- Vera Rubin Strata entrou em produção comercial no fim de julho após um breve atraso, com CPUs Vera aprimoradas e GPUs Rubin esperadas até o fim do 4T 2026.
- Configurações Rubin Ultra de dois chiplets e quatro chiplets estão sendo desenvolvidas em paralelo; a versão de dois chiplets pode se adequar ao atual Oberon NVL72, enquanto a versão de quatro chiplets é voltada para sistemas Kyber.
- Múltiplos racks Oberon podem escalar por interconexões de cobre ou ópticas para 144, 288 ou 576 GPUs, e a equipe de pesquisa espera que o hardware protótipo chegue já no 2S 2027.
- A seleção de HBM para o Rubin Ultra permanece indefinida; o treinamento dá maior ênfase à largura de banda, enquanto a inferência de agentes com contexto longo depende mais da capacidade de memória e de cache KV externo de alta velocidade.
- Espera-se que a lista de materiais do Rubin Ultra Strata com GPU dupla aumente cerca de 30% em relação ao Rubin Strata no 2S 2026; se as margens brutas permanecerem entre 75% e 80%, o ASP poderá superar US$ 170.000.
Interpretação do relatório
Visão geral
Este relatório atualiza o progresso de desenvolvimento em nível de chip e rack das plataformas Vera Rubin e Rubin Ultra da NVIDIA. A visão central é que o Vera Rubin entrou em produção e continua passando por otimização de desempenho, enquanto o design e a arquitetura de sistema do Rubin Ultra ainda não foram finalizados; dada a alta complexidade do Kyber, a NVIDIA pode primeiro usar uma solução com múltiplos racks Oberon para preencher a lacuna na evolução do produto.
Visões principais
Para o Vera Rubin, a equipe de pesquisa espera que a NVIDIA continue otimizando a CPU Vera e a GPU Rubin por meio de iterações de tape-out, visando um TDP máximo de cerca de 2.300W e desempenho de inferência FP4 alegado de 50PF, aproximadamente 3,3 vezes o do GB300; o desempenho FP4 da SKU padrão de 1.800W pode não superar 40PF. Para o Rubin Ultra, a versão com GPU dupla pode manter o formato Oberon NVL72, enquanto a versão com quatro GPUs corresponde ao Kyber; a SKU de quatro chiplets não foi cancelada, mas sua comercialização pode ser mais lenta. Sistemas multi-rack podem expandir um pool unificado de GPUs para até 576 GPUs e, juntamente com racks de rede e armazenamento, melhorar a largura de banda, a capacidade computacional e a competitividade de custo por token.
Estrutura de análise
O relatório realiza análise de cenários sobre topologia de chips, especificações de HBM, interconexões de rack, largura de banda do sistema e precificação com base em pesquisa do setor, inferências de roteiros de produtos, exemplos de demonstrações públicas e estimativas de lista de materiais.
Notas metodológicas
Avalia em camadas a CPU Vera, a GPU Rubin, HBM, encapsulamento e sistemas de rack.
Ao comparar soluções de dois chiplets, quatro chiplets, Oberon, Kyber e multi-rack, avalia os caminhos de atualização de desempenho e o cronograma de comercialização.
Deriva preços de venda de módulos a partir de custos de componentes, participação da memória e margens brutas-alvo.
A equipe de pesquisa espera que o aumento de custo do Rubin Ultra Strata seja impulsionado principalmente por HBM, SoCAAM, dispositivos lógicos e componentes relacionados ao encapsulamento, e usa isso para derivar o ASP potencial.
Cargas de trabalho de treinamento enfatizam largura de banda de memória, enquanto a inferência de agentes com contexto longo enfatiza capacidade e armazenamento de cache KV.
O relatório argumenta que simplesmente aumentar a largura de banda de HBM não resolve a capacidade insuficiente de memória e que arquiteturas de armazenamento CMX/eSSD podem complementar a inferência de contexto longo.
Mapeamento e comparação de ativos
Mapeamento estruturado da tese para ativos nomeados (pontos fortes, pontos fracos, pares e riscos).
- NVDA.USPrincipal empresa coberta e fornecedora de plataformas
- Pontos fortes
- Vera Rubin já está em produção em massa; o desempenho de CPU/GPU está sendo continuamente otimizado; a empresa possui capacidades de produto em nível de sistema que abrangem chips, encapsulamento, redes e racks de armazenamento; arquiteturas multi-rack podem melhorar a largura de banda total e a flexibilidade.
- Pontos fracos
- O desempenho do Rubin Ultra com GPU dupla ainda não foi divulgado; a capacidade e as especificações de HBM não foram finalizadas; os custos e o consumo de energia de sistemas de alto desempenho continuam aumentando.
- Comparação
- Em comparação com um único rack NVL72, sistemas multi-rack podem fornecer maior largura de banda agregada; em comparação com o complexo Kyber, soluções de expansão baseadas no Oberon existente podem ser implantadas mais rapidamente.
- Riscos
- Atrasos no tape-out e na integração de sistemas, adiamento da comercialização do Kyber, pressão de oferta e custos de HBM, aceitação incerta pelos clientes de um aumento de preço de aproximadamente 30% e desenvolvimento interno acelerado de ASICs pelos clientes.
Dados principais
- Momento de produção em massa do Vera Rubin StrataFim de julho de 2026O relatório afirma que entrou em produção comercial após um breve atraso.
- TDP máximo do Vera Rubin aprimoradoAproximadamente 2.300WO nível-alvo esperado pela equipe de pesquisa para a combinação aprimorada de CPU e GPU.
- Desempenho de inferência FP4 do Vera Rubin50PFEsta é a meta alegada pela empresa; o relatório afirma que é cerca de 3,3 vezes a do GB300.
- Tape-out esperado do Rubin Ultra4T 2026A expectativa do relatório para o tape-out do chiplet de GPU; o momento específico permanece incerto.
- TDP máximo do Rubin UltraAproximadamente 2.600WAplica-se à configuração Vera Rubin Ultra com GPU dupla estimada pela equipe de pesquisa.
- Meta de desempenho do Rubin Ultra de quatro chiplets100PF FP4Na GTC 2026, a NVIDIA mencionou uma versão com quatro GPUs pareada com 1T HBM4E; o desempenho da GPU dupla não foi divulgado.
- Escala de GPUs multi-rack144 a 576 GPUsPode escalar por configurações de dois, quatro ou oito racks.
- Momento potencial de implantação multi-rack2S 2027Com base em inferências de pesquisa do setor sobre hardware protótipo pareado com Rubin Ultra.
- Largura de banda HBM4E por pilhaAté aproximadamente 4,1TBpsCom base em um exemplo com velocidade de 16Gbps e largura de barramento de 2.048 bits.
- Largura de banda total de 12 pilhas HBM4EAproximadamente 49,2TBpsO relatório estima que isso seja 50% superior a oito módulos HBM.
- Variação de custo do Rubin Ultra StrataAproximadamente +30%Em relação à previsão para o Rubin Strata no 2S 2026.
- ASP potencial do Rubin Ultra StrataAcima de US$ 170.000Pressupõe que a NVIDIA mantenha margens brutas entre 75% e 80%.
Impacto e implicações
Para a NVIDIA, a escalabilidade multi-rack pode sustentar a oferta de computação e a diferenciação em nível de sistema enquanto o Kyber avança, além de apoiar diferentes cargas de trabalho de IA por meio de interconexões de alta largura de banda e armazenamento CMX. Para provedores de serviços em nuvem e clientes de hiperescala, a maior capacidade do sistema pode reduzir o custo por token, mas o dispêndio total de capital também aumentará ainda mais de 2027 a 2028, potencialmente impulsionando necessidades de financiamento externo ou acelerando o desenvolvimento interno de ASICs.
Riscos
- Os chips e as arquiteturas de rack do Rubin Ultra permanecem em desenvolvimento, e os cronogramas de tape-out, validação e produção em massa podem atrasar.
- O design de GPU de quatro chiplets e de sistema de rack do Kyber é complexo, e a comercialização pode avançar mais lentamente do que as soluções com múltiplos Oberon.
- As configurações de capacidade, velocidade e largura de banda do HBM4E não foram finalizadas; uma capacidade menor pode restringir a inferência de agentes com contexto longo.
- Aumentos de preços de HBM, SoCAAM, encapsulamento e outros componentes podem elevar os custos da lista de materiais e reduzir a flexibilidade de precificação.
- Se o ganho de desempenho do Rubin Ultra com GPU dupla for insuficiente, os clientes podem não aceitar um potencial aumento de preço de aproximadamente 30%.
- Sistemas multi-rack aumentarão o dispêndio de capital dos clientes, potencialmente levando clientes de hiperescala a acelerar o desenvolvimento interno de ASICs para reduzir a dependência de GPUs comerciais.
Pontos a observar
- Progresso de tape-out, desempenho e oferta de CPUs Vera aprimoradas e GPUs Rubin no 4T 2026.
- Especificações oficiais, desempenho FP4 e configurações HBM4E para SKUs Rubin Ultra de dois chiplets e quatro chiplets.
- Finalização do produto e cronograma de comercialização dos racks Kyber, bem como a implantação de sistemas multi-Oberon/Polyphe no 2S 2027.
- Progresso de implantação de racks de armazenamento CMX e BlueField 4 STX e resultados de certificação de fornecedores de eSSD.
- Mudanças nos custos de HBM, SoCAAM e encapsulamento, bem como precificação do Rubin Ultra e feedback de compras dos clientes.
- Dispêndio de capital, atividades de financiamento e estratégias internas de ASIC de provedores de serviços em nuvem e clientes de hiperescala.