China humanoid robot and embodied AI commercialization研报解读
高盛总结的小组观点认为,具身 AI 正从演示走向商业验证。初期应用预计将出现在当前技术能力可满足速度、精度和泛化要求的狭窄物流、零售和工业任务中。
摘要
高盛总结的小组观点认为,具身 AI 正从演示走向商业验证。初期应用预计将出现在当前技术能力可满足速度、精度和泛化要求的狭窄物流、零售和工业任务中。
- 瓶颈已从单项任务成功转向同时提升可靠性、泛化能力和部署经济性。
- 商业应用可能要求接近100%的可靠性;在部分工业场景中,85%的成功率仍可能不足。
- 小组认为真实世界数据和仿真数据是互补投入,关键指标是每一美元带来的智能提升。
- 世界模型可能取代或与 VLA 系统结合,但稳定的现实世界操控是商业化的最终检验。
- 初期部署预计集中于分拣、包装、折叠和柔性物体处理等受限任务。
研报解读
概览
本报告梳理了中国人形机器人和具身 AI 生态的商业化路径。小组认为,技术正进入早期部署验证阶段,但商业规模化取决于能否解决可靠性、泛化能力、数据生产率、算力效率以及与具体应用场景的匹配问题。
核心观点
小组的核心观点是,具身 AI 已越过围绕研究演示的热度,进入早期商业化阶段。约束已不再是模型能否完成某个孤立任务,而是可靠性、泛化能力和部署经济性能否同步改善。Sudo 的 Robin Han 指出,客户不会因为任务困难而降低可靠性要求:从50%-60%的成功率提升至85%在技术上具有意义,但在商业应用要求接近100%表现的情况下,特别是在部分工业用例中,仍可能不足。NoeMatrix.ai 的 Cewu Lu 补充称,部署成本既是工程问题也是科学问题,表明模型设计可能仍未充分优化;他提到约10,000小时的 pi 式训练,说明进步不只是依赖蛮力扩展。 小组认为,数据而非模型能力的固有上限是更直接的瓶颈。Galaxea 的 Tianqi Luo 表示,如果数据路径得到解决,规模化可能显著加快:收集1 million hours数据可能需要一年,而一旦数据收集实现规模化,10 million hours也可能在相近的一年时间内实现。他将当前具身智能描述为大致相当于三至四岁儿童的水平,并认为如果数据收集持续改善,其在不到五至十年内可能达到十岁以上儿童的水平。由于算力相较于数据本身是更大的成本驱动因素,报告强调数据质量和生产率对于避免浪费算力至关重要。 在技术架构方面,小组讨论了世界模型会否取代视觉—语言—行动(VLA)系统,还是与其结合形成 World Action Models。Lu 认为,世界模型凭借更强的记忆、空间推理、分析能力及对物理状态变化的理解,应在中短期内胜过纯 VLA;但当前架构距离应对更复杂的机器人任务仍有很大差距。Luo 则描述了一条融合路径:VLA 将视觉和语言映射为行动,世界模型预测环境动态和行动后果,而 World Action Model 将对未来环境的想象与可执行行动生成相结合。Han 提出的商业检验不依赖于具体架构:胜出的方式将是能把理解和推理转化为现实世界中稳定、可靠操控的方式。 报告反对将真实世界数据和仿真数据视为非此即彼的选择。Luo 认为,真正的差异化在于完整闭环系统——企业如何收集、处理、评估、训练和反馈数据,以及每单位数据、算力、人才和资本能产生多少能力。Han 表示,仿真不可或缺,因为真实机器人数据收集受速度、成本和效率限制,尽管仿真到真实世界的差距依然显著。Lu 认为,UMI、Ego 等当前数据格式不太可能是最终答案,且可能在数年内过时,但它们仍可用于构建覆盖数据、软件、训练方法、分发理解和评估的可复用基础设施。因此,仿真和真实世界数据应被视为更广泛优化问题中的互补变量,而非相互竞争的路径。 在商业化方面,小组预计物流、部分零售应用和工业子任务将更早部署;较狭窄、边界更清晰的工作流可能先于要求99%+可靠性的应用落地。小组认为,更有意义的视角是哪些可复用技能会首先成熟,例如分拣、包装、折叠和柔性物体处理,因为一旦某个模型驱动工作流成功运行,后续场景可通过重组底层能力更快扩展。客户需求由速度、精度和泛化能力的不同组合构成;初期可服务的机会是当前技术最能匹配这些要求的场景。
分析框架
报告综合会议小组讨论,并围绕四个相互关联的问题组织商业化展望:部署瓶颈、模型架构、数据策略和初期应用场景。它通过小组成员对技术和运营的观察,说明可靠性、数据生产率、算力成本和可复用机器人技能如何影响从演示走向商业部署的路径。
方法论与常识提炼
“每一美元的智能效率”
小组将其作为实用的效率视角:关键问题并非企业主要依赖仿真还是真实世界数据,而是每单位有效数据、算力、人才和资本能够产生多少模型能力。
技术能力与商业场景的匹配
讨论将商业化描述为从狭窄、边界清晰的任务逐步走向更广泛应用的早期阶段,前提是可靠性和可复用技能不断提升。初期机会是现有速度、精度和泛化能力能够匹配客户需求的场景。
关键数据
- 商业成功率门槛Close to 100%报告指出,在部分工业用例中,85%的任务成功率仍可能不足。
- 技术改进示例50%-60% to 85%说明有意义的技术进步可能仍不足以满足商业可靠性要求。
- pi 式训练时长Around 10,000 hours用于讨论模型设计可能尚未充分优化。
- 潜在数据扩展示例1 million hours and 10 million hours小组认为,一旦数据收集实现规模化,两者都可能在相近的一年时间内收集完成。
- 具身智能发展观点From roughly three-to-four years old to ten-plus years old in less than five to ten years以数据收集持续改善为条件。
- 高可靠性用例门槛99%+ reliability这类用例预计会更晚到来,因为其对模型、技能和硬件性能的要求更高。
影响与含义
报告表明,短期商业化应更偏向边界清晰的任务,而不是广泛的通用机器人部署。它强调,数据系统生产率、算力效率和可复用技能的成熟是可能加速应用的主要因素;架构选择的重要性主要在于其能否改善稳定的现实世界操控。
风险
- 如果可靠性、泛化能力和部署经济性不能同步改善,商业部署可能延后。
- 要求接近完美或99%+可靠性的用例,对模型、机器人技能和硬件提出特别高的门槛。
- 仿真对于规模化是必要的,但仿真到真实世界的差距仍然显著。
- 较差的数据质量或生产率可能浪费算力,而小组将算力描述为更大的成本驱动因素。