Interpretação de relatórios
Cobertura das pesquisas mais recentes dos principais bancos de investimento de Wall Street
Interpretação do relatórioHilo Research

Agentic AI for dynamic factor investing: Comitês seletivos de LLM são promissores para rotação de fatores europeus, mas o QMI segue como referência

O J.P. Morgan conclui que agentes LLM de escopo restrito podem transformar dados macroeconômicos amplos em classificações de regime úteis e retornos positivos em rotação de fatores. O melhor comitê de dois modelos melhora o equilíbrio e os drawdowns, mas o viés de antecipação residual e a inclinação pessimista dos modelos impedem que substitua o QMI.

InstituiçãoJPMorgan
Data20260917
Setorquantitative equity strategy

Resumo

O J.P. Morgan conclui que agentes LLM de escopo restrito podem transformar dados macroeconômicos amplos em classificações de regime úteis e retornos positivos em rotação de fatores. O melhor comitê de dois modelos melhora o equilíbrio e os drawdowns, mas o viés de antecipação residual e a inclinação pessimista dos modelos impedem que substitua o QMI.

Sem recomendação de ativo ou preço-alvo
Agentic AILLMregimes macroeconômicosrotação de fatoresações europeiasestratégia quantitativaviés de antecipaçãoensembles de modelos
  • Todos os sinais de regime de LLM testados geraram retornos excedentes positivos no backtest europeu de 1994-2026.
  • O comitê de GPT 5.5 e Opus 4.8 gerou 6.0% de retorno excedente anualizado, Sharpe ratio de 0.68 e máximo drawdown de -10.6%.
  • O comitê de dois modelos coincidiu com os regimes do QMI em 48.1%, ante 39.1% para o comitê de seis modelos.
  • A anonimização de datas reduz, mas não elimina, o risco de os modelos recordarem episódios macroeconômicos históricos.
  • Ambos os comitês projetaram Expansion para setembro de 2026, enquanto o QMI do J.P. Morgan permanecia em Slowdown nos EUA e Contraction na Europa.

Interpretação do relatório

Visão geral

Este estudo de estratégia quantitativa europeia testa se agentes LLM podem classificar regimes macroeconômicos mensais e rotacionar carteiras de fatores de ações com base neles. O J.P. Morgan vê o método como um complemento promissor, em especial com modelos novos e selecionados, mas não como substituto de seu framework sistemático QMI.

Visões principais

O relatório testa se um LLM com tarefa estritamente definida consegue ler um pacote macroeconômico amplo, atribuir probabilidades a Expansion, Slowdown, Contraction e Recovery para o mês seguinte e transformar essas chamadas em rotação rentável de fatores de ações europeias. A motivação é que estilos de ações isolados podem sofrer drawdowns severos nas mudanças de regime; rotacionar entre carteiras de fatores por fase do ciclo pode preservar potencial de alta e reduzir a exposição antes das mudanças de liderança. O J.P. Morgan usa seu QMI europeu como benchmark de regime e como referência sistemática estabelecida para rotação de estilos. O agente recebe um pacote macroeconômico generalista, em vez de indicadores direcionados. Os dados cobrem crescimento, trabalho, inflação, política e condições financeiras nos EUA, Reino Unido e Europa, incluindo PMI, desemprego, CPI/HICP, taxas de política, curvas de juros, yields reais, dólar americano, petróleo, volatilidade e spreads de crédito. Cada série traz nível, mudanças de 1/3/6/12 meses quando aplicável e z-score móvel de 36 meses. Os quatro regimes combinam o nível de atividade versus tendência com a direção de melhora ou deterioração, refletindo a visão de que a segunda derivada dos dados macroeconômicos pode importar mais do que o nível para a liderança esperada dos estilos. O estudo trata o viés de antecipação como o principal risco de implementação. Como LLMs podem reconhecer períodos históricos a partir dos dados de treinamento, dados defasados e não revisados não garantem um backtest fora da amostra. Em testes de ablação com Opus 4.8, as sequências de regime continuaram coerentes após remover datas e após remover tanto datas quanto níveis brutos, sugerindo que o modelo usa a evidência macroeconômica remanescente. Contudo, a entrada apenas com a data ainda produziu padrões históricos plausíveis, especialmente perto do episódio dot-com, da Crise Financeira Global e da COVID, indicando memória histórica residual. Trocar os nomes de regime por rótulos neutros manteve as chamadas com dados macroeconômicos amplamente inalteradas: o acordo foi 80%-83% e o Cohen's kappa ficou em 0.71-0.76 nas três variantes com dados macro, contra 59% e 0.45 na variante apenas com data. O J.P. Morgan conclui que o agente raciocina principalmente a partir de dados macroeconômicos quando há evidência real, mas que o vazamento não pode ser eliminado. O estudo avalia GPT 5.5, GPT 5.4, GPT 5.1, Claude Opus 4.8, Sonnet 4.6 e Haiku 4.5 com pacotes anonimizados por data, modo de raciocínio baixo e temperatura de 1. Como os resultados são estocásticos, cada modelo é executado 100 vezes por mês, com probabilidades médias ou agregação por maioria. O bootstrap de 200 chamadas observadas por data mostra que datas consensuais estabilizam rapidamente, enquanto datas ambíguas podem exigir cerca de 100 execuções para o limiar de erro mais estrito; os ganhos além disso são marginais. O relatório identifica o viés direcional como questão de primeira ordem: vários modelos mais antigos escolhem Slowdown e Contraction em excesso. Haiku 4.5 passou mais de 80% da amostra em fases negativas e nunca chamou Recovery, enquanto GPT 5.5 e Opus 4.8 tiveram uma distribuição de regimes mais equilibrada e mais próxima ao QMI. Ensembles melhoram os resultados somente quando seus membros são capazes e equilibrados. A agregação dos seis modelos preservou o viés pessimista compartilhado, enquanto o comitê seletivo de GPT 5.5 e Opus 4.8 ficou mais alinhado ao QMI. Em 391 observações mensais, o comitê de dois membros coincidiu com o QMI em 48.1%, versus 39.1% para o comitê de seis. Sua precision e recall para Expansion foram 46.0% e 36.4%, ante 36.1% e 11.8% no comitê maior; para Recovery, precision e recall foram ambas 47.4%, versus 33.7% e 39.5%. A contrapartida é que o comitê de dois membros muda de fase com maior frequência, implicando maior turnover e custos de transação, ao passo que o comitê de seis membros é mecanicamente mais suave. Na implementação, o relatório rotaciona entre quatro carteiras de ações por fase de ciclo conforme a chamada mensal de regime e aplica uma regra de confirmação de dois meses nas transições para reduzir turnover. No backtest de excesso long de MSCI Europe de 1994-2026, todas as estratégias LLM geraram retornos excedentes positivos, e os modelos mais novos em geral converteram isso em resultados realizados melhores. O comitê de dois membros teve o maior retorno anualizado entre os agentes, 6.0%, Sharpe ratio de 0.68, hit rate de 60.3% e o menor máximo drawdown, -10.6%. O comitê de seis membros teve 5.6%, Sharpe ratio de 0.72, hit rate de 60.8% e máximo drawdown de -20.1%. O QMI Cycle Investing permaneceu à frente, com 7.2% de retorno anualizado, Sharpe ratio de 0.74 e máximo drawdown de -17.9%. Em long/short, o QMI entregou o maior retorno, 13.7%, e Sharpe ratio de 1.39, embora algumas variantes de agentes tenham superado esse Sharpe ratio com menor volatilidade e drawdowns mais rasos. O J.P. Morgan alerta que o desempenho aparentemente superior dos modelos mais novos pode estar concentrado em torno de 2020, quando efeitos de reconhecimento histórico podem ser especialmente relevantes. Também adverte que Sharpe ratios podem ser enganosos para modelos antigos: Haiku 4.5 e GPT 5.1 tiveram Sharpe ratios próximos ao QMI, mas seus retornos de 3.9% e 4.4% ficaram abaixo dos 7.2% do QMI, sugerindo menor volatilidade e não melhor inferência de regime. Para setembro de 2026, quatro dos seis modelos chamaram Expansion e dois Slowdown; ambos os comitês escolheram Expansion, com probabilidades de 0.49 para o grupo de dois membros e 0.43 para o de seis. Os modelos construtivos destacaram PMIs acima de 50, volatilidade benigna e spreads de crédito apertados; os cautelosos enfatizaram enfraquecimento do momentum do Reino Unido e da zona do euro, inflação persistente e política ainda restritiva. O relatório vê essa divisão como evidência de um ambiente difícil de ponto de inflexão e mantém o QMI como referência confiável, enquanto considera Agentic AI um possível complemento à medida que as capacidades dos modelos melhoram.

Estrutura de análise

O J.P. Morgan define quatro regimes macroeconômicos, fornece a cada LLM um prompt fixo e um pacote macroeconômico multiindicador anonimizado por data, e repete o exercício em seis modelos e 100 execuções mensais. Testa vazamento por ablações de dados, data e rótulos; compara modelos individuais e comitês ao QMI; e faz backtest dos sinais em carteiras europeias de fatores por fase de ciclo com uma regra de confirmação de dois meses.

Notas metodológicas

  • Teoria quantitativa, de fatores e de portfóliosModelo multifatorial

    Rotação multifator baseada no ciclo

    A estratégia rotaciona entre quatro carteiras de fatores de ações desenhadas para diferentes regimes macroeconômicos, usando chamadas de regime como sinal mensal de alocação.

  • Teoria quantitativa, de fatores e de portfóliosAnálise de fatores de estilo

    Liderança de estilos de ações vinculada ao regime

    O relatório vincula mudanças no ciclo macroeconômico aos estilos de ações que devem liderar, buscando evitar drawdowns quando a liderança de fatores muda.

  • OutroOutro

    Testes de ablação, agregação de ensembles e reamostragem bootstrap

    Os pesquisadores removem datas, níveis brutos e nomes de regime para testar vazamento; agregam chamadas dos modelos em comitês; e usam reamostragem bootstrap para selecionar 100 execuções por data como padrão prático de estabilidade.

Mapeamento e comparação de ativos

Mapeamento estruturado da tese para ativos nomeados (pontos fortes, pontos fracos, pares e riscos).

  • MSCI Europe cycle-phase equity factor portfolios
    O backtest rotaciona entre quatro carteiras específicas de fase de ciclo usando chamadas de regime de LLM ou QMI.
    Pontos fortes
    Comitês LLM seletivos geraram retornos excedentes positivos e melhoraram os resultados de baixa no teste de excesso long.
    Pontos fracos
    Nenhum LLM ou comitê superou o resultado de QMI Cycle Investing em toda a amostra.
    Comparação
    O comitê de dois membros de GPT 5.5 e Opus 4.8 superou agentes individuais e o comitê de seis modelos em retorno excedente anualizado e máximo drawdown.
    Riscos
    Viés de antecipação residual, pessimismo dos modelos, desempenho concentrado em períodos históricos específicos e maior turnover por mudanças de regime mais frequentes.

Dados principais

  • Período do backtest1994-2026Análise de rotação de fatores europeia com pacotes macroeconômicos anonimizados por data
  • Taxa de coincidência com QMI do comitê de dois membros48.1%Versus 39.1% para o comitê de seis membros em 391 meses
  • Retorno anualizado de excesso long do comitê de dois membros6.0%Sharpe ratio de 0.68; hit rate de 60.3%; máximo drawdown de -10.6%
  • Retorno anualizado de excesso long do QMI Cycle Investing7.2%Sharpe ratio de 0.74; máximo drawdown de -17.9%
  • Acordo de rótulos de fase com informação macroeconômica80%-83%Cohen's kappa foi 0.71-0.76, versus 59% de acordo e kappa de 0.45 com entrada apenas de data
  • Chamada do comitê para setembro de 2026ExpansionProbabilidade de 0.49 e confidence de 0.63 para o comitê de dois membros; probabilidade de 0.43 e confidence de 0.65 para o comitê de seis membros

Impacto e implicações

O relatório argumenta que LLMs podem se tornar um sinal complementar de regime para timing dinâmico de fatores de ações, sobretudo por meio de ensembles seletivos de modelos novos. Não os considera substitutos do QMI devido ao risco persistente de memória histórica, ao viés direcional, aos trade-offs de turnover e ao desempenho superior do QMI em toda a amostra.

Riscos

  • LLMs podem reconhecer episódios históricos a partir de seus dados de treinamento, de modo que a anonimização de datas não garante pureza fora da amostra.
  • Vários modelos apresentam viés pessimista persistente em direção a Slowdown e Contraction, o que pode distorcer as saídas do comitê.
  • Os resultados mais fortes de backtest dos modelos mais novos parecem concentrados em torno de 2020, quando efeitos de reconhecimento histórico podem ser especialmente influentes.
  • O comitê de dois membros, mais preciso, muda de regime com maior frequência, implicando maior turnover e custos de transação.
  • Sharpe ratios podem superestimar a habilidade de modelos antigos quando a baixa volatilidade decorre de menos mudanças de regime, e não de melhor inferência.

Pontos a observar

  • Se novas gerações de LLM continuam melhorando o equilíbrio de regimes e o desempenho realizado de rotação de fatores.
  • Se testes futuros podem reduzir ou isolar ainda mais os efeitos de antecipação e memória histórica.
  • O equilíbrio entre precisão do comitê e custos de turnover ao adicionar ou remover modelos.
  • Momentum de PMI europeu, inflação, restritividade da política, spreads de crédito e volatilidade para avaliar o debate entre Expansion e Slowdown.

Configurações

Entre para ver os logins recentes