Artificial intelligence研报解读
Citi认为,递归自我改进的早期信号、推理成本下降和更优的应用编排正在扩大AI智能飞轮。该机构维持判断:即使更多算力被配置到安全和对齐工作,其对全球AI需求相关CapEx的预测,即2026年$1T和2027年$1.6T,仍不太可能受到影响。
摘要
Citi认为,递归自我改进的早期信号、推理成本下降和更优的应用编排正在扩大AI智能飞轮。该机构维持判断:即使更多算力被配置到安全和对齐工作,其对全球AI需求相关CapEx的预测,即2026年$1T和2027年$1.6T,仍不太可能受到影响。
- 平均实际服务成本较5月28日峰值下降54%,较7月1日下降43%。
- Z.ai的Infra Agent在不足两周内将GLM-5.3-Flash投入生产,并在超过100,000个加速器上将吞吐量提升至三倍。
- 提供商适配器编排将ARC-AGI-3表现提升至99.95%,此前为62.71%,同时将成本降低28%。
- 当周仅发布1个专有模型和3个开放模型,但过去90天的发布量仍为68个专有模型和40个开放模型。
研报解读
概览
这份Citi AI行业更新考察递归自我改进、推理成本下降和应用层进步能否复利式地提升实际AI智能水平及基础设施需求。报告的核心结论是,安全与对齐工作可能改变算力配置,但更可能增加而非减少整体算力需求和AI投资周期。
核心观点
Citi将递归自我改进(RSI)的早期证据视为潜在的新算力需求来源。Google的Dream-RSI及相关进展表明,模型可能越来越多地参与开发其后继模型。Citi指出,讨论重点正从模型发布时间转向稀缺算力的配置。Meta据称为优先处理安全问题而推迟Muse,以及其大部分算力用于服务用户而非参与RSI竞赛的说法,说明前沿开发正与安全、可审计性和对齐之间取得平衡。尽管如此,Citi认为这种重新配置不应改变其对全球AI需求相关CapEx的预测:2026年$1T、2027年$1.6T。 报告认为,基础设施自动化是通向RSI的重要桥梁。Z.ai的Infra Agent据称在不足两周内将GLM-5.3-Flash投入生产,在超过100,000个加速器上将吞吐量提升至三倍,并在六天内帮助处理超过62T个tokens。尽管Citi强调该工具距离RSI仍很远,但其认为自主优化能够加快模型开发,同时提高对推理和治理基础设施的需求。由于高级网络安全能力而延迟发布GLM-5.3权重,以及AI Infra Summit上的讨论,都支持Citi的观点:将算力分配给安全与对齐工作可能增加整体算力需求。 更低的部署成本和更高的效率被视为相辅相成的需求驱动因素。Unsloth对GLM-5.3的量化在保留约81%准确率的同时将模型缩小83%,降低了本地部署的内存和加速器需求。Citi认为,更低的部署门槛可以扩大本地AI采用,改善对敏感数据的控制,并有助于形成大规模RSI的条件。这与Ramp记录的七个行业中六个行业实现环比采用增长相一致。另据报告,平均实际服务成本较5月28日峰值下降54%,较7月1日下降43%,并环比下降2%,Citi将其视为内部和外部使用增长的利好。 最新一周的模型发布节奏放缓:发布了1个专有模型和3个开放模型,前一周分别为5个和6个,四周前分别为3个和6个。但过去90天的数量达到68个专有模型和40个开放模型;在9月初发布高峰后,专有模型发布量环比增长31%,开放模型保持不变。Citi还表示,自8月1日以来约69%的发布为相应提供商创下新的智能水平高点。该机构提示,关于某前沿模型提供商在月末附近发布模型的未经证实传闻,可能检验能力提升能否在模型路由日益普及的情况下重新引导高端使用需求。 最后,Citi认为,编排设计正成为实际智能水平的主要决定因素,而不仅仅是底层模型本身。在交互式ARC-AGI-3基准测试中,为同一模型增加提供商适配器编排后,表现提高37个百分点,从62.71%升至99.95%,成本降低28%,从$26.1K降至$18.8K。Salesforce同样通过迭代其智能体编排,在不改变底层模型的情况下,将七项企业智能体任务的平均成功率从29.2%提升至78.0%。Citi的结论是,越来越多的实际智能提升可能来自编排设计,从而强化应用层作为提供商和企业差异化来源的地位。
分析框架
Citi结合对模型发布、智能基准、定价和使用指标的周度跟踪,以及对AI基础设施、部署优化和智能体编排设计的案例研究。报告将这些信号与算力配置、采用情况和AI相关资本开支影响联系起来。
方法论与常识提炼
AI算力供需与服务成本分析
Citi利用服务成本、算力配置、模型发布和基础设施效率的变化,评估AI需求与算力需求可能如何演变。
从AI基础设施到部署的传导
报告将基础设施自动化和更低的模型内存需求,与更广泛的部署、推理使用、治理需求和AI算力需求联系起来。
关键数据
- 全球AI需求相关CapEx$1T in 2026; $1.6T in 2027Citi的预测;其认为即使更多算力被配置到安全和对齐工作,该预测仍应保持不变。
- 平均实际服务成本Down 54% from the May 28 peak, 43% since July 1, and 2% WoWCiti将服务成本下降视为使用量增长的利好。
- Z.ai Infra Agent吞吐量Tripled across 100K+ accelerators; 62T+ tokens processed in 6 days该系统在不足两周内将GLM-5.3-Flash投入生产。
- GLM-5.3量化~81% accuracy; 83% smallerCiti引用Unsloth量化案例,认为其降低了本地部署的内存和加速器需求。
- 最新模型发布量1 proprietary and 3 open较上周的5个和6个下降;过去90天总量为68个专有模型和40个开放模型。
- ARC-AGI-3编排结果99.95% from 62.71%; $18.8K from $26.1K在使用同一模型的情况下,提供商适配器编排增加37个百分点的表现,并将成本降低28%。
- Salesforce企业智能体任务成功率78.0% from 29.2%七项任务的改善来自迭代智能体编排,而非改变底层模型。
影响与含义
Citi的分析表明,效率提升未必会降低AI基础设施需求:成本下降可以扩大使用和部署,而面向RSI的开发以及安全、对齐和治理工作可以增加算力需求。报告还强调,编排设计正成为应用层竞争差异化日益重要的来源。
风险
- 如GLM-5.3案例所示,高级网络安全能力可能延迟模型权重发布。
- 安全、可审计性和对齐要求可能改变前沿模型算力的节奏和配置。
后续跟踪
- 某前沿模型提供商在月末附近的模型发布,能否在模型路由环境下凭借能力提升重新引导高端使用需求。
- 提供商如何在用户服务、模型开发、安全、可审计性和对齐之间配置算力。
- 推理服务成本、模型发布节奏和部署效率的进一步变化。
- 即将举行的AI和基础设施活动,包括Meta Connect、OpenAI DevDay、OCP Global Summit和NVIDIA GTC。