Humanoid robotics brain-model development and generalization:Helix 2.5展现场景泛化能力,但人形机器人距离通用化商业部署仍很遥远
Bernstein认为,Figure AI的Helix 2.5表明专有的人类视频数据和一体化脑模型正在改善人形机器人表现。报告强调,在未见过的住宅中实现56%的任务成功率具有实质进展意义,但并不代表已具备可迁移的零样本任务能力或商业化准备就绪。
摘要
Bernstein认为,Figure AI的Helix 2.5表明专有的人类视频数据和一体化脑模型正在改善人形机器人表现。报告强调,在未见过的住宅中实现56%的任务成功率具有实质进展意义,但并不代表已具备可迁移的零样本任务能力或商业化准备就绪。
- Helix 2.5在30个未见过的住宅中完成三项经训练的家庭任务,整体成功率为56%。
- Index预训练将零样本成功率从9%提升至56%,同时将达到Helix 02表现所需的数据量减半。
- Bernstein认为,专有数据以及模型与数据的整合正在成为关键竞争壁垒。
- 下一步测试是相关任务间可迁移的技能,以及从约50–60%的成功率高效提升至99%可靠性的路径。
研报解读
概览
这份全球自动化报告将Figure AI的Helix 2.5演示评估为人形机器人场景泛化能力的具体进展。Bernstein认为,该结果强化了可扩展专有数据和紧密整合的机器人脑模型的重要性,但尚未解决通用任务和大规模部署问题。
核心观点
Figure AI的Helix 2.5在30个没有训练数据的住宅中完成了客厅整理、毛巾折叠和铺床三项任务,整体成功率为56%。Bernstein将其定义为场景泛化:机器人能够在此前未见的环境中运行并完成全身移动操作,但三项任务均经过专门训练。不同住宅中的物品变化和摆放差异也有限。因此,报告将这一进展与真正的零样本任务泛化区分开来,并认为后者仍有很长的路要走。 报告将大部分改进归因于Index数据集,即Figure AI的专有第一视角人类任务视频语料库。在其他变量不变的情况下,Index预训练将整体零样本成功率从9%提升至56%,并将达到Helix 02表现所需的数据量减半。截至2026年8月,Index包含23 million videos,并且每秒新增约35分钟的人类经验;每收集1,000小时数据代表373项任务、1,146个被操作物体和116种环境。Bernstein还指出,随着人类到机器人的预训练数据扩大,动作预测损失持续下降,并将其解读为规模效应的早期证据。 Bernstein认为,机器人模型可用训练数据的范围正在扩大。第一视角人类视频越来越适合预训练,而真实机器人数据仍然有价值,但由于难以规模化,遥操作的重要性可能会下降。报告还看到数据与模型的整合正在加深:Helix 2.5并非依赖固定权重的视觉语言模型,而是在专有数据上从头训练。报告将Figure AI与AgiBot的GE-ACT 2.0、Dyna Robotics的Dyna 2.0和Physical Intelligence的π0.7并列,视为行业正朝着更广泛的数据模态、数据与脑模型整合、规模化和泛化发展的证据。 关键的下一阶段里程碑比当前演示要求更高。Bernstein希望看到机器人在一种任务上训练后,无需额外训练即可完成相似任务的证据;报告特别指出Physical Intelligence的π0.7在组合式任务泛化方面具有代表性,即由相关的已学技能涌现出未经训练的新技能。报告也强调,56%的成功率尚不足以商业部署。其将关注后训练和部署数据飞轮是否能够自动改善表现,并认为从约50–60%的预训练成功率高效迈向99%可靠性是下一项重大考验。总体而言,Bernstein认为,超出少数应用的通用任务和大规模部署尚未临近,但脑模型发展正按季度快速取得可见进展。
分析框架
Bernstein通过区分未见场景中的表现与未经训练任务上的表现来评估Helix 2.5演示,随后比较预训练结果和数据集规模,以识别专有人类视频数据的作用。报告再通过比较多家公司机器人脑模型的架构、数据构成和披露的规模化证据扩展评估,并提出未来发布版本的商业化检验标准。
方法论与常识提炼
机器人模型开发中的数据规模化与数据—脑模型整合
报告将专有训练数据视为人形机器人表现的关键投入,通过比较数据集规模、构成和预训练结果,说明更大、更丰富的数据供给为何可能改善模型能力。
针对覆盖自动化公司的前瞻EV/EBITDA估值
对于覆盖股票,Bernstein将目标EV/EBITDA倍数应用于一年期前瞻EBITDA预测;倍数参考过往周期,并根据长期或竞争趋势进行调整。
DCF作为长期内在价值的参考
Bernstein将DCF用作长期估值参考,并指出基于周期的目标价可能与DCF隐含价值不同。
标的映射与对比
研报将主题/逻辑映射到具体标的时的结构化摘要(优势、劣势、对比与风险)。
- Keyence (6861.JP)覆盖的自动化公司,评级为跑赢大盘。
- 对比
- 目标价JPY95,000,相比JPY76,580的收盘价;基于JPY913.2bn一年期前瞻EBITDA给予22x EV/EBITDA。
- 风险
- 制造产能利用率低于预期、全球自动化需求疲弱,以及JPY升值。
- Cognex (CGNX)覆盖的自动化公司,评级为跑赢大盘。
- 对比
- 目标价USD85.00,相比USD61.99的收盘价;基于USD372.6 million一年期前瞻EBITDA给予36.5x EV/EBITDA。
- 风险
- 全球自动化需求疲弱、新兴客户计划进展较慢,或Moritex整合及协同效应兑现延迟。
- FANUC (6954.JP)覆盖的自动化公司,评级为跑赢大盘。
- 对比
- 目标价JPY7,200,相比JPY5,852的收盘价;基于JPY255bn一年期前瞻EBITDA给予23.0x EV/EBITDA。
- 风险
- 全球自动化需求疲弱、市场份额流失和JPY升值。
- Harmonic Drive Systems (6324.JP)覆盖的自动化公司,评级为跑赢大盘。
- 优势
- 在应变波减速器领域拥有超过50%的全球份额。
- 劣势
- 鉴于其市场份额,竞争格局变化对其尤为重要。
- 对比
- 目标价JPY7,800,相比JPY6,200的收盘价;基于JPY16,194 million一年期前瞻EBITDA给予45.5x EV/EBITDA。
- 风险
- 机器人需求疲弱、市场份额流失和JPY升值。
- Shenzhen Inovance Technology-A (300124.CH)覆盖的自动化公司,评级为跑赢大盘。
- 对比
- 目标价CNY82.00,相比CNY54.05的收盘价;基于CNY8,971.6 million一年期前瞻EBITDA给予24.0x EV/EBITDA。
- 风险
- 中国自动化需求疲弱、伺服电机和VFD以外领域的份额提升较慢,以及EV需求疲弱。
- Estun Automation Co Ltd (2715.HK; 002747.CH)覆盖的自动化公司,评级为与大盘持平。
- 优势
- 利润率扩张和市场份额提升可能快于预期。
- 劣势
- Cloos整合和计划协同效应的实现仍是投资逻辑的重要组成部分。
- 对比
- H股目标价HKD17.12,相比HKD14.80;A股目标价CNY31.60,相比CNY29.68。两项目标价均基于CNY681.4 million一年期前瞻EBITDA给予45.5x EV/EBITDA。
- 风险
- 中国自动化需求疲弱、利润率改善或市场份额提升较慢,以及Cloos整合和协同效应兑现延迟。
关键数据
- Helix 2.5整体成功率56%在30个未见过的住宅中完成三项家庭任务。
- 采用Index预训练后的零样本成功率9% to 56%在其他变量不变的情况下实现的提升。
- Index数据集规模23 million videos截至2026年8月;每秒新增约35分钟的人类经验。
- Index每1,000小时数据的多样性373 tasks, 1,146 manipulated objects, 116 environments报告披露的已收集数据构成。
- Keyence目标价JPY95,000相比2026年9月18日JPY76,580的收盘价。
- Cognex目标价USD85.00相比2026年9月18日USD61.99的收盘价。
- FANUC目标价JPY7,200相比2026年9月18日JPY5,852的收盘价。
- Harmonic Drive目标价JPY7,800相比2026年9月18日JPY6,200的收盘价。
- Inovance目标价CNY82.00相比2026年9月18日CNY54.05的收盘价。
- Estun目标价CNY31.60 for A-shares; HKD17.12 for H-shares相比2026年9月18日的CNY29.68和HKD14.80。
影响与含义
报告认为,专有数据收集、预训练规模以及专有模型训练正在成为人形机器人领域竞争差异化的关键来源。报告支持对所覆盖自动化供应商的建设性观点,同时警示当前人形机器人能力尚未达到广泛商业部署的门槛。
风险
- 通用任务能力和广泛部署仍未得到验证;Bernstein认为当前56%的成功率不足以实现商业部署。
- 报告指出,从约50–60%的预训练成功率高效迈向99%可靠性仍是一项挑战。
- 覆盖的自动化公司面临全球或中国自动化需求疲弱、工业资本开支周期、竞争、贸易摩擦和汇率变动等明确风险。
后续跟踪
- 未来版本是否展示出无需额外训练即可在相关任务间迁移的技能。
- 是否出现能够自动改善机器人表现的后训练和部署数据飞轮证据。
- 当前预训练成功率向99%可靠性迈进的进展。
- 更大规模的人类视频数据集是否改善机器人在未见任务上的表现。