Agentic AI for dynamic factor investing: 선별적 LLM 위원회는 유럽 팩터 로테이션에 유망하지만 QMI가 여전히 기준
J.P. Morgan은 엄격히 범위를 제한한 LLM 에이전트가 광범위한 거시 데이터를 유용한 레짐 분류와 플러스 팩터 로테이션 수익으로 전환할 수 있다고 본다. 최적의 2개 모델 위원회는 균형과 낙폭을 개선했지만, 잔존하는 선행정보 편향과 모델의 비관적 편향으로 QMI를 대체하지는 못한다.
요약
J.P. Morgan은 엄격히 범위를 제한한 LLM 에이전트가 광범위한 거시 데이터를 유용한 레짐 분류와 플러스 팩터 로테이션 수익으로 전환할 수 있다고 본다. 최적의 2개 모델 위원회는 균형과 낙폭을 개선했지만, 잔존하는 선행정보 편향과 모델의 비관적 편향으로 QMI를 대체하지는 못한다.
- 1994-2026년 유럽 백테스트에서 테스트한 모든 LLM 레짐 신호가 플러스 초과수익을 냈다.
- GPT 5.5와 Opus 4.8 위원회는 6.0% 연환산 초과수익, 0.68 Sharpe ratio, -10.6% 최대 낙폭을 기록했다.
- 2개 모델 위원회의 QMI 레짐 일치율은 48.1%로 6개 모델 위원회의 39.1%를 상회했다.
- 날짜 익명화는 모델이 과거 거시 사건을 기억할 위험을 낮추지만 제거하지는 못한다.
- 두 위원회 모두 2026년 9월 Expansion을 예측했지만, J.P. Morgan의 QMI는 미국 Slowdown 및 유럽 Contraction에 머물렀다.
보고서 해설
개요
이 유럽 퀀트 전략 연구는 LLM 에이전트가 월간 거시 레짐을 분류하고 이에 따라 주식 팩터 포트폴리오를 로테이션할 수 있는지 검증한다. J.P. Morgan은 특히 더 새롭고 선별된 모델을 사용할 때 보완적 입력으로 유망하다고 결론 내리지만, QMI 체계의 대체재는 아니라고 본다.
핵심 견해
보고서는 엄격히 정의된 LLM이 광범위한 거시 컨텍스트 팩을 읽고 다음 달의 Expansion, Slowdown, Contraction, Recovery에 확률을 배분한 뒤, 이를 수익성 있는 유럽 주식 팩터 로테이션으로 전환할 수 있는지 검토한다. 개별 주식 스타일은 레짐 전환 시 큰 낙폭을 겪을 수 있으며, 경기 국면별 팩터 포트폴리오 간 로테이션은 리더십 변화 전에 상승 여력을 유지하면서 익스포저를 낮출 수 있다. J.P. Morgan은 유럽 QMI를 레짐 벤치마크이자 스타일 로테이션의 기존 체계적 기준으로 사용한다. 에이전트에는 표적화된 신호 대신 일반적인 거시 팩이 제공된다. 입력은 미국, 영국 및 유럽의 성장, 노동, 인플레이션, 정책, 금융여건을 포괄하며 PMI, 실업률, CPI/HICP, 정책금리, 수익률곡선, 실질금리, 미국 달러, 유가, 변동성, 신용스프레드를 포함한다. 각 시계열에는 수준, 해당 시 1/3/6/12개월 변화, 36개월 롤링 z-score가 포함된다. 네 레짐은 추세 대비 활동 수준과 개선 또는 악화 여부로 정의되며, 거시 데이터의 2차 변화가 수준 자체보다 예상 스타일 리더십에 더 중요할 수 있다는 관점을 반영한다. 보고서는 선행정보 편향을 핵심 실행 위험으로 본다. LLM은 학습 데이터에서 역사적 시기를 인식할 수 있으므로, 시차를 둔 비수정 데이터를 사용해도 표본 외 백테스트를 보장할 수 없다. Opus 4.8의 제거 실험에서 날짜를 빼고, 나아가 날짜와 원시 수준 데이터를 모두 빼도 레짐 경로는 일관성을 유지해 모델이 남은 거시 증거를 사용할 수 있음을 시사했다. 그러나 날짜만 제공해도 특히 닷컴 시기, 글로벌 금융위기, COVID 전후에 그럴듯한 역사적 레짐 패턴이 나타나 역사 기억이 남아 있음을 보여줬다. 익숙한 레짐명을 중립 라벨로 바꾸어도 거시 정보가 있는 판단은 대체로 유지됐다. 세 가지 거시 데이터 변형에서 일치율은 80%-83%, Cohen's kappa는 0.71-0.76이었지만, 날짜만 있을 때는 일치율 59%, kappa 0.45였다. 따라서 J.P. Morgan은 실제 증거가 주어지면 에이전트가 주로 거시 데이터를 바탕으로 추론하지만, 누출 위험은 제거할 수 없다고 결론 내린다. 연구는 GPT 5.5, GPT 5.4, GPT 5.1, Claude Opus 4.8, Sonnet 4.6, Haiku 4.5를 날짜 익명화 팩, 저추론 모드, 온도 1로 테스트했다. 출력은 확률적이므로 연구진은 각 모델을 월별 100회 실행하고 평균 확률 또는 다수결형 집계를 사용한다. 날짜별 200회 관측 호출에 대한 bootstrap 재표본화는 합의가 강한 날짜는 빠르게 안정되지만, 모호한 날짜는 가장 엄격한 오류 임계값에 도달하기 위해 약 100회 실행이 필요할 수 있음을 보여준다. 그 이후 개선은 제한적이다. 보고서는 체계적 방향 편향을 최우선 이슈로 지목한다. 일부 구형 모델은 Slowdown과 Contraction을 과도하게 선택한다. Haiku 4.5는 표본 기간의 80% 이상을 부정적 레짐에 배분했고 Recovery를 한 번도 호출하지 않은 반면, GPT 5.5와 Opus 4.8은 더 균형 잡히고 QMI에 가까운 레짐 구성을 보였다. 앙상블은 구성원이 충분히 우수하고 균형적일 때만 성과를 개선한다. 6개 모델을 모두 통합하면 공통의 비관적 편향이 남았지만, GPT 5.5와 Opus 4.8의 선별적 위원회는 QMI와 더 가깝게 정렬됐다. 391개월 관측에서 2개 모델 위원회의 QMI 일치율은 48.1%, 6개 모델 위원회는 39.1%였다. 2개 모델 위원회의 Expansion precision과 recall은 각각 46.0%와 36.4%로 대규모 위원회의 36.1%와 11.8%보다 높았다. Recovery precision과 recall은 모두 47.4%였고, 대규모 위원회는 33.7%와 39.5%였다. 대가로 2개 모델 위원회는 레짐을 더 자주 전환해 회전율과 거래비용이 더 높으며, 6개 모델 위원회는 기계적으로 더 매끄럽다. 실행 단계에서는 각 모델의 월간 레짐 판단을 이용해 네 개의 사이클 단계별 주식 포트폴리오를 로테이션하고, 레짐 전환 시 회전율을 줄이기 위해 2개월 확인 규칙을 적용한다. 1994-2026년 MSCI Europe 초과 롱 백테스트에서 모든 LLM 전략은 플러스 초과수익을 냈고, 더 새로운 모델이 대체로 더 강한 실현 성과를 보였다. 2개 모델 위원회는 에이전트 전략 중 가장 높은 6.0% 연환산 수익, 0.68 Sharpe ratio, 60.3% 적중률, 가장 낮은 -10.6% 최대 낙폭을 기록했다. 6개 모델 위원회는 5.6% 수익, 0.72 Sharpe ratio, 60.8% 적중률, -20.1% 최대 낙폭을 기록했다. QMI Cycle Investing은 7.2% 연환산 수익, 0.74 Sharpe ratio, -17.9% 최대 낙폭으로 여전히 앞섰다. 롱/쇼트 기준에서 QMI는 가장 높은 13.7% 수익과 1.39 Sharpe ratio를 기록했지만, 일부 에이전트 변형은 더 낮은 변동성과 얕은 낙폭으로 더 높은 Sharpe ratio를 냈다. J.P. Morgan은 새 모델의 더 강한 외견상 성과가 2020년 전후에 집중됐을 수 있으며, 역사 인식 효과가 이 시기에 특히 성과를 부풀릴 수 있다고 경고한다. 또한 전환 횟수가 적은 구형 모델에서는 Sharpe ratios가 오해를 낳을 수 있다. Haiku 4.5와 GPT 5.1의 Sharpe ratios는 QMI에 가깝지만, 각각 3.9%와 4.4% 수익은 QMI의 7.2%에 못 미쳐 더 나은 레짐 추론이 아니라 낮은 변동성을 반영할 수 있다. 2026년 9월에 대해 6개 모델 중 4개는 Expansion, 2개는 Slowdown을 예측했고, 두 위원회 모두 Expansion을 선택했다. 2개 모델 위원회의 확률은 0.49, 6개 모델 위원회는 0.43이었다. 낙관적 모델은 50을 웃도는 PMI, 낮은 변동성, 타이트한 신용스프레드를 강조했고, 신중한 모델은 영국과 유로존 모멘텀 둔화, 고착적 인플레이션, 여전히 제약적인 정책을 강조했다. 보고서는 이 분열을 어려운 전환점 환경의 증거로 보며, QMI를 신뢰할 수 있는 기준으로 유지하는 한편 모델 역량이 개선됨에 따라 Agentic AI가 유용한 보완 입력이 될 수 있다고 본다.
분석 프레임워크
J.P. Morgan은 네 개의 거시 레짐을 정의하고 각 LLM에 고정 프롬프트와 날짜 익명화된 다중 지표 거시 팩을 제공한 뒤, 6개 모델과 월별 100회 실행에 걸쳐 반복했다. 데이터, 날짜, 라벨 제거 실험으로 누출을 검증하고, 개별 모델 및 위원회 판단을 QMI와 비교하며, 2개월 확인 규칙을 적용해 유럽 사이클 단계별 팩터 포트폴리오에서 신호를 백테스트했다.
방법론 메모
사이클 기반 멀티팩터 로테이션
이 전략은 레짐 판단을 월간 배분 신호로 사용해 서로 다른 거시 국면을 위해 설계된 네 개의 주식 팩터 포트폴리오 간에 로테이션한다.
레짐 연계 주식 스타일 리더십
보고서는 거시 사이클 변화를 우세할 것으로 예상되는 주식 스타일과 연결해 팩터 리더십 전환 시의 낙폭을 피하고자 한다.
제거 실험, 앙상블 집계, bootstrap 재표본화
연구진은 날짜, 원시 수준, 레짐명을 제거해 누출을 검증하고 모델 판단을 위원회로 집계하며, bootstrap 재표본화로 날짜당 100회 실행을 실용적 안정성 기준으로 정했다.
자산 매핑 및 비교
투자 논리에서 명시된 자산으로의 구조화 매핑(강점, 약점, 비교 대상, 위험).
- MSCI Europe cycle-phase equity factor portfolios보고서는 LLM 또는 QMI 레짐 판단을 활용해 네 개의 사이클 단계별 포트폴리오 간에 로테이션한다.
- 강점
- 선별적 LLM 위원회는 초과 롱 테스트에서 플러스 초과수익을 냈고 하방 결과를 개선했다.
- 약점
- 어떤 LLM이나 위원회도 QMI의 전 표본 Cycle Investing 결과를 넘지 못했다.
- 비교
- GPT 5.5와 Opus 4.8의 2개 모델 위원회는 연환산 초과수익과 최대 낙폭에서 개별 에이전트 및 6개 모델 위원회를 상회했다.
- 위험
- 잔존 선행정보 편향, 모델의 비관적 편향, 특정 역사적 기간에 집중된 성과, 더 빈번한 레짐 전환에 따른 높은 회전율.
핵심 데이터
- 백테스트 기간1994-2026날짜 익명화 거시 팩을 사용한 유럽 팩터 로테이션 분석
- 2개 모델 위원회의 QMI 일치율48.1%391개월 기준으로 6개 모델 위원회는 39.1%
- 2개 모델 위원회의 초과 롱 연환산 수익6.0%Sharpe ratio 0.68, 적중률 60.3%, 최대 낙폭 -10.6%
- QMI Cycle Investing의 초과 롱 연환산 수익7.2%Sharpe ratio 0.74, 최대 낙폭 -17.9%
- 거시 정보가 있는 국면 라벨 일치율80%-83%Cohen's kappa는 0.71-0.76이며, 날짜만 입력한 경우 일치율은 59%, kappa는 0.45
- 2026년 9월 위원회 판단Expansion2개 모델 위원회 확률은 0.49, confidence는 0.63이며 6개 모델 위원회 확률은 0.43, confidence는 0.65
영향과 시사점
보고서는 LLM이 동적 주식 팩터 타이밍을 위한 보완적 레짐 신호가 될 수 있으며, 특히 새로운 모델의 선별적 앙상블에서 그러하다고 본다. 다만 지속되는 역사 기억 위험, 방향 편향, 회전율의 상충관계, 전 표본에서의 QMI 우위 성과 때문에 QMI의 대체재로 보지는 않는다.
위험
- LLM은 학습 데이터에서 역사적 사건을 인식할 수 있어 날짜 익명화가 표본 외 순도를 보장하지 않는다.
- 여러 모델은 Slowdown과 Contraction에 대한 지속적 비관적 편향을 보여 위원회 출력을 왜곡할 수 있다.
- 새 모델의 가장 강한 백테스트 성과는 2020년 전후에 집중된 것으로 보이며, 역사 인식 효과가 이 시기에 특히 클 수 있다.
- 더 정확한 2개 모델 위원회는 레짐을 더 자주 전환하므로 회전율과 거래비용이 높아진다.
- 낮은 변동성이 더 나은 추론이 아니라 드문 레짐 전환에서 나온 경우 Sharpe ratios는 구형 모델의 역량을 과대평가할 수 있다.
주시할 점
- 새 세대 LLM이 레짐 구성의 균형과 실현 팩터 로테이션 성과를 계속 개선하는지.
- 향후 테스트가 선행정보 및 역사 기억 효과를 추가로 줄이거나 분리할 수 있는지.
- 모델을 추가하거나 제외할 때 위원회 정확도와 회전율 비용 간의 균형.
- Expansion과 Slowdown 논쟁을 평가하기 위한 유럽 PMI 모멘텀, 인플레이션, 정책 제약성, 신용스프레드, 변동성.