Agentic AI for dynamic factor investing: Los comités selectivos de LLM son prometedores para la rotación de factores europea, pero QMI sigue siendo la referencia
J.P. Morgan concluye que agentes LLM con una tarea acotada pueden convertir datos macroeconómicos amplios en clasificaciones de régimen útiles y rentabilidades positivas de rotación de factores. El mejor comité de dos modelos mejora el equilibrio y los drawdowns, pero el sesgo de anticipación residual y el sesgo pesimista de los modelos impiden que sustituya a QMI.
Resumen
J.P. Morgan concluye que agentes LLM con una tarea acotada pueden convertir datos macroeconómicos amplios en clasificaciones de régimen útiles y rentabilidades positivas de rotación de factores. El mejor comité de dos modelos mejora el equilibrio y los drawdowns, pero el sesgo de anticipación residual y el sesgo pesimista de los modelos impiden que sustituya a QMI.
- Todas las señales de régimen LLM probadas generaron rentabilidades excedentes positivas en el backtest europeo de 1994-2026.
- El comité de GPT 5.5 y Opus 4.8 obtuvo 6.0% de rentabilidad excedente anualizada, un Sharpe ratio de 0.68 y un máximo drawdown de -10.6%.
- El comité de dos modelos coincidió con los regímenes de QMI el 48.1%, frente al 39.1% del comité de seis modelos.
- La anonimización de fechas reduce, pero no elimina, el riesgo de que los modelos recuerden episodios macroeconómicos históricos.
- Ambos comités proyectaron Expansion para septiembre de 2026, mientras que el QMI de J.P. Morgan permanecía en Slowdown en EE. UU. y Contraction en Europa.
Interpretación del informe
Visión general
Este estudio de estrategia cuantitativa europea analiza si los agentes LLM pueden clasificar regímenes macroeconómicos mensuales y rotar carteras de factores de renta variable en consecuencia. J.P. Morgan considera el enfoque prometedor como señal complementaria, especialmente con modelos más nuevos y seleccionados, pero no como sustituto de su marco sistemático QMI.
Perspectivas principales
El informe estudia si un LLM con una tarea estrictamente definida puede leer un paquete macroeconómico amplio, asignar probabilidades a Expansion, Slowdown, Contraction y Recovery para el mes siguiente, y convertir esas decisiones en una rotación rentable de factores de renta variable europea. La motivación es que los estilos de renta variable individuales pueden sufrir drawdowns extremos durante cambios de régimen; rotar entre carteras de factores específicas de cada fase puede preservar el potencial alcista y reducir exposición antes de cambios en el liderazgo. J.P. Morgan utiliza su QMI europeo tanto como referencia de régimen como marco sistemático establecido para la rotación de estilos. El agente recibe un paquete macroeconómico generalista en lugar de señales seleccionadas. Incluye crecimiento, empleo, inflación, política y condiciones financieras de EE. UU., Reino Unido y Europa, con PMI, desempleo, CPI/HICP, tipos oficiales, curvas de rendimientos, rendimientos reales, dólar estadounidense, petróleo, volatilidad y spreads de crédito. Cada serie incluye su nivel, variaciones de 1/3/6/12 meses cuando corresponde y un z-score móvil de 36 meses. Los cuatro regímenes se definen por el nivel de actividad respecto de tendencia y por si las condiciones mejoran o empeoran, reflejando que la segunda derivada de los datos macroeconómicos puede importar más que el nivel para el liderazgo esperado de los estilos. El estudio trata el sesgo de anticipación como el riesgo central de implementación. Los LLM pueden reconocer períodos históricos a partir de los datos de entrenamiento, por lo que el uso de datos retrasados y no revisados no garantiza un backtest fuera de muestra. En pruebas de ablación con Opus 4.8, las secuencias de régimen siguieron siendo coherentes al eliminar fechas y al eliminar tanto fechas como niveles brutos, lo que indica que el modelo puede usar la evidencia macroeconómica restante. No obstante, al recibir solo la fecha produjo patrones de régimen históricos plausibles, sobre todo en torno al episodio dot-com, la Crisis Financiera Global y COVID, lo que señala memoria histórica residual. Sustituir los nombres de régimen por etiquetas neutrales dejó las decisiones con datos macroeconómicos ampliamente intactas: el acuerdo fue 80%-83% y Cohen's kappa fue 0.71-0.76 en las tres variantes con datos macro, frente a 59% y 0.45 con solo la fecha. J.P. Morgan concluye que el agente razona principalmente a partir de datos macroeconómicos cuando dispone de evidencia real, pero que la fuga de información no puede eliminarse. El análisis prueba GPT 5.5, GPT 5.4, GPT 5.1, Claude Opus 4.8, Sonnet 4.6 y Haiku 4.5 con paquetes anonimizados por fecha, modo de razonamiento bajo y temperatura de 1. Dado que las salidas son estocásticas, los investigadores ejecutan cada modelo 100 veces por mes y usan probabilidades promedio o agregación tipo mayoría. El remuestreo bootstrap de 200 llamadas observadas por fecha muestra que las fechas de consenso se estabilizan rápidamente, mientras que las fechas ambiguas pueden requerir cerca de 100 ejecuciones para alcanzar el umbral de error más estricto; las ganancias posteriores son marginales. El informe identifica el sesgo direccional sistemático como problema de primer orden: varios modelos antiguos seleccionan en exceso Slowdown y Contraction. Haiku 4.5 pasó más del 80% de la muestra en fases negativas y nunca llamó Recovery, mientras que GPT 5.5 y Opus 4.8 mostraron una mezcla más equilibrada y más cercana a QMI. Los ensambles solo mejoran los resultados cuando sus miembros son suficientemente capaces y equilibrados. Agrupar los seis modelos conservó el sesgo pesimista compartido, mientras que el comité selectivo de GPT 5.5 y Opus 4.8 se alineó más estrechamente con QMI. En 391 observaciones mensuales, el comité de dos miembros coincidió con QMI 48.1% de las veces, frente a 39.1% para el grupo de seis. Su precision y recall para Expansion fueron 46.0% y 36.4%, frente a 36.1% y 11.8% para el comité mayor; para Recovery, precision y recall fueron ambas 47.4%, frente a 33.7% y 39.5%. El coste es que el comité de dos miembros cambia de fase con mayor frecuencia, lo que implica más turnover y costes de transacción, mientras que el comité de seis miembros es mecánicamente más suave. Para la implementación, el informe rota entre cuatro carteras de renta variable por fase de ciclo según la señal mensual de cada modelo y aplica una regla de confirmación de dos meses en las transiciones para reducir turnover. En el backtest de exceso long de MSCI Europe de 1994-2026, todas las estrategias LLM generaron rentabilidades excedentes positivas y, en general, los modelos más nuevos lograron mejores resultados realizados. El comité de dos miembros alcanzó la mayor rentabilidad anualizada de los agentes, 6.0%, con Sharpe ratio de 0.68, hit rate de 60.3% y el drawdown máximo más estrecho, -10.6%. El comité de seis miembros obtuvo 5.6%, Sharpe ratio de 0.72, hit rate de 60.8% y drawdown máximo de -20.1%. QMI Cycle Investing siguió por delante con 7.2% de rentabilidad anualizada, Sharpe ratio de 0.74 y drawdown máximo de -17.9%. En base long/short, QMI entregó la mayor rentabilidad, 13.7%, y un Sharpe ratio de 1.39, aunque varias variantes de agentes superaron ese Sharpe ratio mediante menor volatilidad y drawdowns menos profundos. J.P. Morgan advierte que la aparente superioridad de los modelos más nuevos puede concentrarse alrededor de 2020, cuando los efectos de reconocimiento histórico pueden ser especialmente importantes. También advierte que los Sharpe ratios pueden ser engañosos para modelos antiguos: Haiku 4.5 y GPT 5.1 tuvieron Sharpe ratios cercanos a QMI, pero sus rentabilidades de 3.9% y 4.4% quedaron por debajo del 7.2% de QMI, lo que sugiere menor volatilidad más que una mejor inferencia de régimen. Para septiembre de 2026, cuatro de seis modelos llamaron Expansion y dos Slowdown; ambos comités eligieron Expansion, con probabilidades de 0.49 para el grupo de dos miembros y 0.43 para el de seis. Los modelos constructivos destacaron PMI por encima de 50, volatilidad benigna y spreads de crédito ajustados; los cautelosos destacaron el debilitamiento del momentum británico y de la eurozona, inflación persistente y una política aún restrictiva. El informe considera esta división evidencia de un entorno de punto de inflexión difícil y mantiene QMI como referencia de confianza, al tiempo que ve a Agentic AI como complemento potencial a medida que mejoren las capacidades de los modelos.
Marco de análisis
J.P. Morgan define cuatro regímenes macroeconómicos, entrega a cada LLM un prompt fijo y un paquete macroeconómico multiindicador anonimizado por fecha, y repite el ejercicio en seis modelos y 100 ejecuciones mensuales. Prueba la fuga de información mediante ablaciones de datos, fecha y etiquetas; compara modelos individuales y comités con QMI; y realiza backtests de las señales en carteras europeas de factores por fase de ciclo con una regla de confirmación de dos meses.
Notas metodológicas
Rotación multifactor basada en el ciclo
La estrategia rota entre cuatro carteras de factores de renta variable diseñadas para distintos regímenes macroeconómicos, utilizando las decisiones de régimen como señal mensual de asignación.
Liderazgo de estilos de renta variable vinculado al régimen
El informe relaciona los cambios del ciclo macroeconómico con los estilos de renta variable que se espera lideren, buscando evitar drawdowns cuando cambia el liderazgo de factores.
Pruebas de ablación, agregación de ensambles y remuestreo bootstrap
Los investigadores eliminan fechas, niveles brutos y nombres de régimen para probar fugas de información; agregan las decisiones de los modelos en comités; y usan remuestreo bootstrap para seleccionar 100 ejecuciones por fecha como estándar práctico de estabilidad.
Correspondencia y comparación de activos
Correspondencia estructurada entre la tesis y activos concretos (fortalezas, debilidades, pares y riesgos).
- MSCI Europe cycle-phase equity factor portfoliosEl backtest rota entre cuatro carteras específicas de cada fase de ciclo utilizando decisiones de régimen de LLM o QMI.
- Fortalezas
- Los comités LLM selectivos generaron rentabilidades excedentes positivas y mejoraron los resultados a la baja en la prueba de exceso long.
- Debilidades
- Ningún LLM ni comité superó el resultado de QMI Cycle Investing en toda la muestra.
- Comparación
- El comité de dos miembros de GPT 5.5 y Opus 4.8 superó a los agentes individuales y al comité de seis modelos en rentabilidad excedente anualizada y máximo drawdown.
- Riesgos
- Sesgo de anticipación residual, pesimismo de los modelos, desempeño concentrado en períodos históricos concretos y mayor turnover por cambios de régimen más frecuentes.
Datos clave
- Período de backtest1994-2026Análisis de rotación de factores europea con paquetes macroeconómicos anonimizados por fecha
- Tasa de coincidencia con QMI del comité de dos miembros48.1%Frente a 39.1% del comité de seis miembros en 391 meses
- Rentabilidad anualizada de exceso long del comité de dos miembros6.0%Sharpe ratio de 0.68; hit rate de 60.3%; máximo drawdown de -10.6%
- Rentabilidad anualizada de exceso long de QMI Cycle Investing7.2%Sharpe ratio de 0.74; máximo drawdown de -17.9%
- Acuerdo de etiquetas de fase con información macroeconómica80%-83%Cohen's kappa fue 0.71-0.76, frente a 59% de acuerdo y kappa de 0.45 con entrada de solo fecha
- Decisión del comité para septiembre de 2026ExpansionProbabilidad del comité de dos miembros de 0.49 y confidence de 0.63; probabilidad del comité de seis miembros de 0.43 y confidence de 0.65
Impacto e implicaciones
El informe sostiene que los LLM pueden convertirse en una señal complementaria de régimen para el timing dinámico de factores de renta variable, especialmente mediante ensambles selectivos de modelos nuevos. No los considera un sustituto de QMI debido al riesgo persistente de memoria histórica, el sesgo direccional, los trade-offs de turnover y el mejor desempeño de QMI en toda la muestra.
Riesgos
- Los LLM pueden reconocer episodios históricos a partir de sus datos de entrenamiento, por lo que la anonimización de fechas no garantiza pureza fuera de muestra.
- Varios modelos muestran un sesgo pesimista persistente hacia Slowdown y Contraction, que puede distorsionar las salidas del comité.
- Los mayores resultados de backtest de los modelos más nuevos parecen concentrarse alrededor de 2020, cuando los efectos de reconocimiento histórico pueden ser especialmente influyentes.
- El comité de dos miembros, más preciso, cambia de régimen con mayor frecuencia, lo que implica más turnover y costes de transacción.
- Los Sharpe ratios pueden sobrestimar la habilidad de modelos antiguos cuando la baja volatilidad procede de menos cambios de régimen y no de mejor inferencia.
Aspectos que vigilar
- Si las nuevas generaciones de LLM continúan mejorando el equilibrio de regímenes y el desempeño realizado de la rotación de factores.
- Si las pruebas futuras pueden reducir o aislar más los efectos de anticipación y memoria histórica.
- El equilibrio entre la precisión del comité y los costes de turnover al añadir o eliminar modelos.
- El momentum de PMI europeo, la inflación, la restrictividad de la política, los spreads de crédito y la volatilidad para evaluar el debate entre Expansion y Slowdown.