Humanoid robotics研报解读
报告认为,更强大的世界行动模型、强化学习和模型—数据一体化将推动人形机器人从演示走向商业部署。一旦回收期降至约2.5年以下,应用可能加速,而平台硬件和系统集成商将成为关键差异化来源。
摘要
报告认为,更强大的世界行动模型、强化学习和模型—数据一体化将推动人形机器人从演示走向商业部署。一旦回收期降至约2.5年以下,应用可能加速,而平台硬件和系统集成商将成为关键差异化来源。
- 世界行动模型预计将在长时程自主能力和跨任务泛化方面得到广泛采用。
- 若解决机器人操作的强化学习问题,多数任务成功率可能从约60%提升至99%。
- 报告预计,到2031年四个关键应用可占其100万台人形机器人年出货量预测的约一半。
- 约2.5年的回收期被视为应用决定性加速的门槛。
- 仅收集数据并非护城河;模型—数据一体化和触觉感知被认为更重要。
- 硬件一致性、可靠性以及早期系统集成商的聚集可能决定未来平台赢家。
研报解读
概览
Bernstein提出了未来三年人形机器人的四项预测:更强大的机器人脑、更可能在操作任务上实现的强化学习突破、回收期改善的商业化产品,以及由平台机器人和系统集成商塑造竞争优势的生态系统。报告对行业发展持积极态度,但强调多项技术和执行障碍仍未解决。
核心观点
Bernstein以贝叶斯方法审视早期人形机器人行业:随着新的技术和商业证据出现,不断更新判断。其核心技术观点是,机器人脑正从简单的视觉—语言—动作序列,转向能够在执行前设想行动后果的模型。报告预计,世界模型——尤其是同时建模动作及环境影响的世界行动模型——将在未来三年广泛用于长时程自主能力,以及跨任务和跨机器人形态的泛化。报告并不认为世界模型与VLA彼此排斥,而是预计两者会融合。物理理解仍是重大限制:报告称2026年最优秀的世界模型在综合物理理解评估中仅得22%,这在三年后仍可能构成挑战。 下一个预期前沿是记忆能力与更丰富的多模态输入。当前机器人通常会在相同指令下重复行动,而不能根据此前失败作出调整,或在长任务中跟踪进度。Bernstein预计,机器人脑中的记忆将成为下一项重大突破。报告还预测,第三方视频、第一视角视频和掌侧视频,将与人类和机器人动作、力觉及触觉感知数据实现更好的融合,应用于训练和实时策略生成。报告认为,机器人与其他AI应用的区别在于需要非视频物理数据,但目前这类数据的多样性仍不足,模型也仍难以有效利用即使只是适度扩展的模态。 Bernstein的“AlphaGo时刻”类比聚焦于机器人操作的强化学习。当前训练类似于AlphaGo之前的系统:模型从大量示范中学习,达到基础能力后便陷入停滞。强化学习已改变了运动控制,但操作任务更难,因为复杂任务的奖励函数难以设计,模拟器还必须复现机器人之外的精确物理交互和不断变化的环境。报告认为,关键突破将是解决这一强化学习问题,并高效地将多数任务成功率从60%提升至99%;其判断是重大进展可能仍需数年。因此,报告不认同机器人会出现单一、突发的“ChatGPT时刻”,而更倾向于渐进但可能具有决定性的AlphaGo式训练突破。 报告质疑“部署更多机器人会自动形成自我强化的数据飞轮”这一简单观点。其称,互联网视频、第一视角和腕部摄像头、通用操作接口正使预训练数据更丰富;而后训练阶段更重要的瓶颈,是通过强化学习将数据与任务表现关联起来。报告对比指出,前沿世界行动模型在预训练中使用数百万小时可获取的互联网视频,而后训练仅使用数十小时专有动作数据。这说明训练技术而非原始数据量才是关键瓶颈。触觉数据预计仍将稀缺且有价值,但Bernstein认为,持久护城河在于将数据收集与模型的具体需求结合,而非不加区分地积累数据。 在商业化方面,行业重心正迅速从运动演示转向实际应用。Bernstein列出仓库拣选和放置、工厂物料搬运和检测、城市及工业巡逻、末端送货四个关键应用;合计约占其2031年100万台年出货量预测的一半。报告预计,随着产量上升带动机器人价格下降,回收期将缩短;其援引电动车和电池行业证据称,产量翻倍时成本通常下降15–18%,且低产量阶段降幅更陡。约2.5年的回收期被视为平均应用门槛:大型成熟企业可能接受最长五年,而快速变化行业中的小型企业可能要求约一年。 在产品结构上,Bernstein预计未来三年SKU仍会持续增加,但出货量将集中到少数平台产品,而不是参与者大规模整合。潜在平台产品将针对工厂和仓库物料搬运优化,每条手臂可持续负载10–15 kg。平台地位不仅能带来采购和制造规模优势,也可能吸引模型开发者围绕领先硬件进行设计和训练,形成良性循环。报告认为,在制造经验和商业化规模支持下的硬件一致性与可靠性,是被低估的差异化因素,也是全行业的痛点。 最后,报告认为,行业要实现规模化,需要形成独立的技能层。机器人演示不应与底层脑模型混为一谈:技能是为特定应用学习和部署的能力。随着行业形成多个脑模型、众多机器人制造商、数百种SKU和数千个应用,系统集成商预计将成为缺失的生态环节,帮助部署机器人、收集数据和开展后训练。Bernstein预计这一环节将在未来几年出现,并将系统集成商开始围绕特定机器人制造商聚集的早期证据,视为识别未来硬件赢家的关键信号。 在潜在赢家讨论中,Bernstein强调Physical Intelligence符合其对下一代机器人脑和模型—数据一体化的偏好。报告也提到Figure AI、Nvidia和Google在机器人脑开发中的作用;Dyna Robotics和Rhoda AI则因展示机器人领域早期的规模定律迹象、并将数据需求转向互联网规模的人类视频而受到关注。在中国,报告将Agibot、Galbot和Robotera视为新兴参与者。触觉感知方面,报告关注PaXini和Tashan Technology。平台硬件竞赛尚无明确领先者:Tesla Optimus可能在硬件设计和制造一致性方面占优,但报告称其在模型及数据/训练技术方面似乎落后。
分析框架
报告采用贝叶斯式、随证据更新的方式评估早期行业。其分析从模型架构、记忆能力延伸至数据和强化学习,再将这些发展与机器人经济性、产品平台动态及实现部署所需的生态系统联系起来。
方法论与常识提炼
基于机器人价格、产量带动的成本下降和客户回收期的商业应用经济性。
Bernstein将更高产量与更低机器人成本和更短客户回收期相联系,并以回收期门槛解释应用何时可能加速。
模型—数据一体化、平台硬件、可靠性和系统集成商协同作为竞争差异化来源。
报告认为数据本身并不可防御;更强的护城河来自按模型需求定制数据,而规模、可靠硬件和集成商生态系统能够强化领先平台。
贝叶斯方法
报告明确表示,随着技术、产品和行业结构的新证据出现,其会更新对假设概率的判断。
标的映射与对比
研报将主题/逻辑映射到具体标的时的结构化摘要(优势、劣势、对比与风险)。
- Physical Intelligence被重点提及,其方向符合Bernstein对下一代机器人脑和模型—数据一体化的偏好。
- 优势
- 整合VLA与世界模型的方法;模型—数据一体化。
- 劣势
- 私营公司。
- 对比
- 在报告对脑模型方向的讨论中受到偏好。
- 风险
- 物理理解和操作强化学习挑战仍是全行业问题。
- Tesla Optimus潜在的平台硬件竞争者。
- 优势
- 可能在硬件设计、供应链和制造能力上具备优势。
- 劣势
- 报告称,其在模型及数据/训练技术方面似乎落后。
- 对比
- 尚未出现明确的平台硬件领先者。
- 风险
- 硬件优势能否弥补其他关键技术差距仍未确定。
- Cognex (CGNX)Bernstein股票表中列示的明确覆盖证券。
关键数据
- 世界模型物理理解得分22%报告称,2026年最优秀的世界模型在综合物理理解评估中得分为22%。
- 操作任务成功率的潜在提升60% to 99%Bernstein对解决机器人操作强化学习问题潜在影响的描述。
- 预训练与后训练数据Millions of hours of internet video; tens of hours of proprietary action data说明报告认为训练技术而非原始数据量才是关键瓶颈。
- 预测的人形机器人年出货量1 million in 2031报告所列四个应用约占该预测的一半。
- 产量翻倍时的成本下降15–18%报告援引电动车和电池行业的实证证据,支持产量带动机器人降本的观点。
- 商业应用回收期门槛About 2.5 years被视为应用可决定性加速的平均门槛。
- 潜在平台机器人的负载能力10–15 kg per arm预计为工厂和仓库物料搬运设计的每条手臂可持续负载。
影响与含义
报告认为,行业价值将日益取决于机器人能否将世界建模、记忆和强化学习的进展转化为可靠的操作能力和具吸引力的客户经济性。其预计,差异化将转向脑模型与数据一体化开发、可靠的平台硬件,以及使大量应用中的部署可复制的系统集成商。
风险
- 世界模型可能持续缺乏足够的物理理解;报告称2026年最优秀模型的综合得分为22%。
- 机器人操作强化学习仍受限于奖励函数设计困难,以及物理交互模拟尚不成熟。
- 硬件一致性和可靠性仍是行业范围内的痛点。
- 为生成预训练数据而兴起的通用操作接口热潮可能不可持续。
后续跟踪
- 强化学习是否能显著提高操作任务成功率。
- 机器人记忆能力以及视频、动作、力觉和触觉数据多模态融合的进展。
- 关键商业应用中的机器人经济性是否跨越约2.5年的回收期门槛。
- 系统集成商是否开始围绕特定机器人制造商聚集。
- 触觉感知和模型—数据一体化方法的发展。