研报解读
覆盖华尔街顶级投行最新研报
研报解读河洛投研

Agentic AI for dynamic factor investing:精选LLM委员会展现欧洲因子轮动潜力,但QMI仍是基准

J.P. Morgan发现,严格限定任务的LLM智能体可将广泛宏观数据转化为有用的经济周期分类和正向因子轮动收益。表现最佳的双模型委员会改善了分类平衡和回撤,但残余前视偏差及模型悲观偏向意味着其尚不能取代QMI。

机构JPMorgan
日期20260917
行业quantitative equity strategy

摘要

J.P. Morgan发现,严格限定任务的LLM智能体可将广泛宏观数据转化为有用的经济周期分类和正向因子轮动收益。表现最佳的双模型委员会改善了分类平衡和回撤,但残余前视偏差及模型悲观偏向意味着其尚不能取代QMI。

无证券评级或目标价
Agentic AILLM宏观经济周期因子轮动欧洲股票量化策略前视偏差模型集成
  • 在1994-2026年的欧洲回测中,所有测试的LLM经济周期信号均产生正超额收益。
  • 由GPT 5.5和Opus 4.8组成的委员会实现6.0%年化超额收益、0.68 Sharpe ratio和-10.6%最大回撤。
  • 双模型委员会与QMI经济周期的一致率为48.1%,高于六模型委员会的39.1%。
  • 日期匿名化能够降低但不能消除模型回忆历史宏观事件的风险。
  • 两个委员会均预测2026年9月为Expansion,但J.P. Morgan的QMI仍处于美国Slowdown和欧洲Contraction。

研报解读

概览

这份欧洲量化策略研究检验LLM智能体能否对月度宏观经济周期进行分类,并据此轮动股票因子组合。J.P. Morgan认为该方法作为补充信号具有鼓舞性,尤其是在使用较新且经过精选的模型时,但由于其QMI系统框架仍更优,LLM尚不能成为替代方案。

核心观点

报告考察严格设定任务的LLM能否读取广泛的宏观背景数据包,为下个月的Expansion、Slowdown、Contraction和Recovery分配概率,并将这些判断转化为有盈利能力的欧洲股票因子轮动。其动机在于,单一股票风格在经济周期转换时可能遭遇严重回撤;在与经济周期对应的因子组合之间轮动,可能在主要风格转换前保留上行空间并降低风险敞口。J.P. Morgan将其欧洲QMI同时作为经济周期基准和既有的风格轮动系统化参考框架。 智能体接收的是通用宏观数据包,而非经过针对性挑选的信号。输入涵盖美国、英国和欧洲的增长、劳动力、通胀、政策与金融条件,包括PMI、失业率、CPI/HICP、政策利率、收益率曲线、实际收益率、美元、油价、波动率和信用利差。每项序列均包含其水平、视情况而定的1/3/6/12个月变化,以及36个月滚动z-score。四种经济周期状态由经济活动相对趋势的水平以及状况是在改善还是恶化共同定义,强调宏观数据的二阶变化相较于水平本身,可能更能指引预期的风格领先表现。 报告将前视偏差视为最核心的实施风险。由于LLM可能从训练数据中识别历史事件,即使使用滞后且未经重述的数据,也无法保证样本外回测。使用Opus 4.8的消融测试显示,在移除日期、以及同时移除日期和原始水平数据后,经济周期路径依然连贯,表明模型能够利用剩余的宏观证据。然而,只有日期的输入仍会产生看似合理的历史经济周期模式,特别是在互联网泡沫、全球金融危机和COVID期间,这显示仍存在历史记忆。将熟悉的经济周期名称替换为中性标签后,宏观信息充分时的判断基本未变:在三种包含宏观数据的变体中,一致率为80%-83%,Cohen's kappa为0.71-0.76;而仅有日期输入时,一致率为59%,kappa为0.45。因此,J.P. Morgan认为,在获得真实证据时,智能体主要依据宏观数据推理,但泄漏风险无法消除。 研究测试了GPT 5.5、GPT 5.4、GPT 5.1、Claude Opus 4.8、Sonnet 4.6和Haiku 4.5,使用日期匿名化数据包、低推理模式和温度设为1。鉴于输出具有随机性,研究人员每月对每个模型运行100次,并采用平均概率或多数式聚合。针对每个日期的200次观测调用进行bootstrap重抽样发现,共识明确的日期很快稳定,而模糊日期可能需要约100次运行才能达到最严格的误差阈值;超过该水平后,改善有限。报告将系统性的方向偏向视为首要问题:多款旧模型过度选择Slowdown和Contraction。Haiku 4.5在样本期内超过80%的时间处于负面经济周期状态,且从未预测Recovery;GPT 5.5和Opus 4.8则产生了更均衡、且更接近QMI的经济周期分布。 只有成员足够强且足够均衡时,集成方法才能改善结果。汇集全部六个模型保留了共同的悲观偏向,而由GPT 5.5和Opus 4.8组成的精选委员会则与QMI更加一致。在391个月度观测中,双模型委员会与QMI的一致率为48.1%,六模型委员会为39.1%。双模型委员会对Expansion的precision和recall分别为46.0%和36.4%,高于大委员会的36.1%和11.8%;对Recovery的precision和recall均为47.4%,而大委员会为33.7%和39.5%。代价是,双模型委员会更频繁切换经济周期状态,意味着更高换手率和交易成本;六模型委员会则在机制上更平滑。 在实施层面,报告根据各模型的月度经济周期判断,在四个周期阶段股票组合间进行轮动;在经济周期转换时采用两个月确认规则以降低换手。在1994-2026年MSCI Europe超额多头回测中,所有LLM策略均产生正超额收益,且较新模型总体上实现了更强的实际结果。双模型委员会实现所有智能体策略中最高的6.0%年化收益、0.68 Sharpe ratio、60.3%命中率和最小的-10.6%最大回撤。六模型委员会收益为5.6%,Sharpe ratio为0.72,命中率为60.8%,最大回撤为-20.1%。QMI Cycle Investing仍领先,年化收益为7.2%,Sharpe ratio为0.74,最大回撤为-17.9%。在多空口径下,QMI实现最高的13.7%收益和1.39 Sharpe ratio,尽管若干智能体变体通过较低波动率和较浅回撤获得更高的Sharpe ratio。 J.P. Morgan提醒,较新模型表面上更强的表现可能集中于2020年前后,而历史识别效应在该时期可能最明显。报告还警告,Sharpe ratios可能高估切换较少的旧模型:Haiku 4.5和GPT 5.1的Sharpe ratios接近QMI,但其3.9%和4.4%的收益低于QMI的7.2%,这更可能反映较低波动率,而非更好的经济周期推断。对于2026年9月,六个模型中四个预测Expansion、两个预测Slowdown;两个委员会均选择Expansion,双模型委员会概率为0.49,六模型委员会概率为0.43。偏积极模型强调PMI高于50、低波动率和紧信用利差,而谨慎模型强调英国和欧元区动能走弱、粘性通胀以及政策仍具限制性。报告将这一分歧视为艰难拐点环境的证据,并继续将QMI作为可信参考,同时认为随着模型能力发展,Agentic AI可能成为有用的补充输入。

分析框架

J.P. Morgan定义四种宏观经济周期状态,为每个LLM提供固定提示词和日期匿名化的多指标宏观数据包,并在六个模型和每月100次运行中重复测试。研究通过数据、日期和标签消融检验泄漏风险;将单模型与委员会判断同QMI比较;并使用两个月确认规则,在欧洲周期阶段因子组合中回测所得信号。

方法论与常识提炼

  • 量化/因子/组合理论多因子模型

    基于经济周期的多因子轮动

    该策略利用经济周期判断作为月度配置信号,在为不同宏观阶段设计的四个股票因子组合之间轮动。

  • 量化/因子/组合理论风格因子分析

    经济周期关联的股票风格领先表现

    报告将宏观周期变化与预期领先的股票风格相联系,旨在避免因子领导地位转换时的回撤。

  • 其他

    消融测试、集成聚合和bootstrap重抽样

    研究人员移除日期、原始水平和经济周期名称以检验泄漏;将模型判断聚合为委员会;并通过bootstrap重抽样确定每个日期100次运行为实际可行的稳定性标准。

标的映射与对比

研报将主题/逻辑映射到具体标的时的结构化摘要(优势、劣势、对比与风险)。

  • MSCI Europe cycle-phase equity factor portfolios
    回测根据LLM或QMI的经济周期判断,在四个与周期阶段对应的组合之间轮动。
    优势
    精选LLM委员会在超额多头测试中产生正超额收益,并改善了下行表现。
    劣势
    没有任何LLM或委员会超过QMI的全样本Cycle Investing结果。
    对比
    由GPT 5.5和Opus 4.8组成的双模型委员会,在年化超额收益和最大回撤方面优于单个智能体及六模型委员会。
    风险
    残余前视偏差、模型悲观偏向、表现集中于少数历史时期,以及更频繁经济周期切换带来的更高换手。

关键数据

  • 回测期间1994-2026使用日期匿名化宏观数据包的欧洲因子轮动分析
  • 双模型委员会与QMI一致率48.1%391个月中,六模型委员会为39.1%
  • 双模型委员会超额多头年化收益6.0%Sharpe ratio为0.68;命中率为60.3%;最大回撤为-10.6%
  • QMI Cycle Investing超额多头年化收益7.2%Sharpe ratio为0.74;最大回撤为-17.9%
  • 宏观信息充分时的阶段标签一致率80%-83%Cohen's kappa为0.71-0.76,而仅日期输入时一致率为59%、kappa为0.45
  • 2026年9月委员会判断Expansion双模型委员会概率为0.49、confidence为0.63;六模型委员会概率为0.43、confidence为0.65

影响与含义

报告认为,LLM可成为动态股票因子择时的补充经济周期信号,尤其可通过较新模型的精选集成实现。鉴于持续存在的历史记忆风险、方向偏向、换手权衡以及QMI在全样本中的更优表现,报告并不将其视为QMI的替代品。

风险

  • LLM可能从训练数据中识别历史事件,因此日期匿名化无法保证样本外纯度。
  • 若干模型对Slowdown和Contraction存在持续的悲观偏向,可能扭曲委员会输出。
  • 较新模型最强的回测收益似乎集中于2020年前后,历史识别效应在这一时期可能尤其显著。
  • 更准确的双模型委员会切换经济周期更频繁,意味着更高的换手率和交易成本。
  • 当较低波动率来自较少的经济周期切换而非更好的推断时,Sharpe ratios可能高估旧模型的能力。

后续跟踪

  • 较新一代LLM能否持续改善经济周期分布平衡及实际因子轮动表现。
  • 未来测试能否进一步降低或隔离前视和历史记忆效应。
  • 随着模型增减,委员会准确性与换手成本之间的平衡。
  • 欧洲PMI动能、通胀、政策限制性、信用利差和波动率,以评估Expansion与Slowdown之间的分歧。

设置

登录后可查看最近记录