Artificial intelligence — Interpretação do relatório
A Citi argumenta que os primeiros sinais de melhoria recursiva, os menores custos de inferência e melhores harnesses de aplicação estão ampliando o ciclo de inteligência de IA. A instituição considera improvável que maior alocação de computação para segurança e alinhamento altere suas projeções de CapEx global ligado à demanda de IA de $1T em 2026 e $1.6T em 2027.
Resumo
A Citi argumenta que os primeiros sinais de melhoria recursiva, os menores custos de inferência e melhores harnesses de aplicação estão ampliando o ciclo de inteligência de IA. A instituição considera improvável que maior alocação de computação para segurança e alinhamento altere suas projeções de CapEx global ligado à demanda de IA de $1T em 2026 e $1.6T em 2027.
- O custo médio realizado de atendimento caiu 54% desde o pico de 28 de maio e 43% desde 1 de julho.
- O Infra Agent da Z.ai colocou o GLM-5.3-Flash em produção em menos de duas semanas e triplicou o throughput em mais de 100,000 aceleradores.
- Um harness adaptador de provedor elevou o desempenho do ARC-AGI-3 para 99.95% ante 62.71% e reduziu o custo em 28%.
- Apenas 1 modelo proprietário e 3 modelos abertos foram lançados na semana, mas os lançamentos nos últimos 90 dias permaneceram em 68 proprietários e 40 abertos.
Interpretação do relatório
Visão geral
Esta atualização da Citi sobre o setor de IA examina se a melhoria recursiva, a queda dos custos de inferência e os avanços na camada de aplicações podem elevar de forma composta a inteligência de IA realizada e a demanda por infraestrutura. A conclusão central é que o trabalho de segurança e alinhamento pode redirecionar a computação, mas tem maior probabilidade de elevar os requisitos totais de computação do que de reduzir o ciclo de investimento em IA.
Visões principais
A Citi identifica evidências iniciais de melhoria recursiva (RSI) como uma possível nova fonte de demanda por computação. O Dream-RSI do Google e desenvolvimentos relacionados sugerem que os modelos podem contribuir cada vez mais para desenvolver seus sucessores. A Citi observa que o debate está mudando do momento dos lançamentos de modelos para a alocação de computação escassa. O atraso relatado da Meta no Muse para priorizar segurança, e os comentários de que a maior parte de sua computação é dedicada ao atendimento de pessoas, em vez de uma corrida por RSI, ilustram o equilíbrio entre desenvolvimento de fronteira, segurança, auditabilidade e alinhamento. Ainda assim, a Citi considera que essa realocação não deve alterar suas estimativas de CapEx global relacionado à demanda de IA de $1T em 2026 e $1.6T em 2027. O relatório vê a automação de infraestrutura como uma ponte importante para RSI. O Infra Agent da Z.ai teria colocado o GLM-5.3-Flash em produção em menos de duas semanas, triplicado o throughput em mais de 100,000 aceleradores e ajudado a processar mais de 62T tokens em 6 dias. Embora a Citi enfatize que a ferramenta ainda está distante de RSI, acredita que a otimização autônoma pode acelerar o desenvolvimento de modelos enquanto aumenta a demanda por infraestrutura de inferência e governança. O atraso na divulgação dos pesos do GLM-5.3 devido a recursos avançados de cibersegurança, juntamente com o debate no AI Infra Summit, sustenta a visão de que alocar mais computação para segurança e alinhamento pode elevar os requisitos totais de computação. Custos menores de implantação e maior eficiência são apresentados como motores complementares de demanda. Uma quantização do GLM-5.3 pela Unsloth manteve cerca de 81% de precisão enquanto deixava o modelo 83% menor, reduzindo as necessidades de memória e aceleradores on-premise. A Citi argumenta que barreiras menores à implantação podem ampliar a adoção de IA on-premise, melhorar o controle de dados sensíveis e estabelecer as condições para RSI em escala. Isso é consistente com os ganhos mensais de adoção registrados pela Ramp em 6 de 7 setores. Separadamente, o custo médio realizado de atendimento caiu 54% desde o pico de 28 de maio, 43% desde 1 de julho e 2% na semana, o que a Citi vê como um impulso ao crescimento do uso interno e externo. O ritmo de lançamentos de modelos desacelerou na última semana: foram lançados 1 modelo proprietário e 3 abertos, ante 5 e 6 na semana anterior e 3 e 6 quatro semanas antes. Ainda assim, o total dos últimos 90 dias alcançou 68 lançamentos proprietários e 40 abertos; os lançamentos proprietários subiram 31% no mês após a alta do início de setembro, enquanto os abertos ficaram estáveis. A Citi também informa que cerca de 69% dos lançamentos desde 1 de agosto estabeleceram um novo máximo de inteligência para seu provedor. A especulação não confirmada sobre o lançamento de um modelo por um provedor de fronteira perto do fim do mês pode testar se um ganho de capacidade consegue redirecionar o uso premium apesar da crescente adoção de roteamento de modelos. Por fim, a Citi argumenta que o desenho de harnesses está se tornando um motor central da inteligência realizada, em vez de apenas o modelo subjacente. No benchmark interativo ARC-AGI-3, adicionar um harness adaptador de provedor ao mesmo modelo elevou o desempenho em 37 pontos percentuais, para 99.95% ante 62.71%, e reduziu o custo em 28%, para $18.8K ante $26.1K. A Salesforce também elevou o sucesso médio em 7 tarefas de agentes empresariais para 78.0% ante 29.2% ao evoluir seu harness de agente sem mudar o modelo subjacente. A Citi conclui que uma parcela crescente dos ganhos práticos de inteligência pode vir dos harnesses, reforçando a camada de aplicações como fonte de diferenciação para provedores e empresas.
Estrutura de análise
A Citi combina o acompanhamento semanal de lançamentos de modelos, benchmarks de inteligência, preços e indicadores de uso com estudos de caso de infraestrutura de IA, otimização de implantação e desenho de harnesses de agentes. Ela relaciona esses sinais à alocação de computação, à adoção e às implicações para gastos de capital ligados à IA.
Notas metodológicas
Análise de oferta e demanda de computação de IA e de custo de atendimento
A Citi usa mudanças nos custos de atendimento, na alocação de computação, nos lançamentos de modelos e na eficiência de infraestrutura para avaliar como a demanda por IA e os requisitos de computação podem evoluir.
Transmissão da infraestrutura de IA para a implantação
O relatório conecta automação de infraestrutura e menores requisitos de memória dos modelos a implantação mais ampla, uso de inferência, necessidades de governança e demanda por computação de IA.
Dados principais
- CapEx global relacionado à demanda de IA$1T in 2026; $1.6T in 2027Projeção da Citi, que considera que ela deve se manter apesar de maior alocação de computação para segurança e alinhamento.
- Custo médio realizado de atendimentoDown 54% from the May 28 peak, 43% since July 1, and 2% WoWA Citi identifica a queda dos custos de atendimento como um impulso ao crescimento do uso.
- Throughput do Z.ai Infra AgentTripled across 100K+ accelerators; 62T+ tokens processed in 6 daysO sistema colocou o GLM-5.3-Flash em produção em menos de duas semanas.
- Quantização do GLM-5.3~81% accuracy; 83% smallerA Citi cita a quantização da Unsloth como redução dos requisitos de memória e aceleradores on-premise.
- Lançamentos mais recentes de modelos1 proprietary and 3 openCaíram ante 5 e 6 na semana; os totais dos últimos 90 dias foram 68 proprietários e 40 abertos.
- Resultado do harness ARC-AGI-399.95% from 62.71%; $18.8K from $26.1KO harness adaptador de provedor acrescentou 37 pontos percentuais de desempenho e reduziu o custo em 28% usando o mesmo modelo.
- Sucesso em tarefas de agentes empresariais da Salesforce78.0% from 29.2%A melhora em 7 tarefas decorreu da evolução do harness de agente, não de uma mudança no modelo subjacente.
Impacto e implicações
A análise da Citi sugere que ganhos de eficiência não precisam reduzir a demanda por infraestrutura de IA: custos menores podem ampliar o uso e a implantação, enquanto o desenvolvimento voltado a RSI e o trabalho de segurança, alinhamento e governança podem adicionar requisitos de computação. Também destaca o desenho de harnesses como uma fonte cada vez mais importante de diferenciação competitiva na camada de aplicações.
Riscos
- Recursos avançados de cibersegurança podem atrasar a divulgação dos pesos de modelos, como no exemplo do GLM-5.3.
- Requisitos de segurança, auditabilidade e alinhamento podem alterar o ritmo e a alocação de computação para modelos de fronteira.
Pontos a observar
- Se o lançamento de um modelo de um provedor de fronteira perto do fim do mês gera ganho de capacidade suficiente para redirecionar o uso premium apesar do roteamento de modelos.
- Como os provedores alocam computação entre atendimento de usuários, desenvolvimento de modelos, segurança, auditabilidade e alinhamento.
- Mudanças adicionais nos custos de atendimento de inferência, no ritmo de lançamentos de modelos e na eficiência de implantação.
- Próximos eventos de IA e infraestrutura, incluindo Meta Connect, OpenAI DevDay, OCP Global Summit e NVIDIA GTC.