9月8日,松延动力发布Scalabot及HERON-World Model。第二天,智元机器人推出AGILE 2.0和GE-Act 2.0。9月10日,宇树科技发布并开源UnifoLM-WLA-1.0。到9月15日,松延动力又发布HERON-CRA。
8天,3家公司,5个具身模型。刚过去的9月是热闹的具身模型发布潮。
过去,机器人公司的聚光灯大多打在身体上:能不能跑、跳、翻跟头,关节是否灵活,本体是否足够轻。这个9月,发布会上的关键词变成了世界模型、感知控制、错误恢复和多任务操作。
考试科目换了。
但新问题也随之出现:模型发布了,机器人“大脑”究竟该怎么验收?
本体公司集体“补脑”
几家公司给出的答案并不相同。宇树的UnifoLM-WLA-1.0采用6B参数,使用约2500小时真机数据,可以统筹完成64项移动操作和桌面操作任务。宇树还开放了代码、权重和数据集,将基座模型、多任务能力与开源放在一起。
智元同时押注两条路线。AGILE 2.0强调感知与控制一体,让机器人边获取环境信息边执行动作;GE-Act 2.0则继续扩大数据规模,探索数据量增加100倍后能否出现更强的通用能力。
松延动力把重点放在预测和纠错。HERON-World Model用于理解环境,并在行动前推演未来;HERON-CRA强调记忆过去、从错误中学习,再把一次经验用于后续任务。
这些动作背后,还有组织和资源的变化。
公开报道显示,松延动力从2025年下半年开始组建独立模型团队,2026年增加AI研发投入,研发路线从单一硬件本体转向硬件与具身智能双轨。
截至2026年5月,智元拥有1570多名员工,其中70%以上从事具身大模型研发。不过,宇树与松延没有披露相同口径的人员数据,三家公司之间无法据此比较投入高低。
竞争由此向产业链上游延伸。本体厂商过去主要解决执行器、关节和运动控制,现在还要承担模型训练、数据采集、算力投入、机器人适配和场景验证。
开源也改变了利益分配。开发者和下游集成商可以获得宇树的代码、权重及数据集,使用门槛可能降低;宇树则有机会让更多开发者围绕自己的模型和本体做适配。现有材料没有披露商业使用限制、后续服务收费和客户留存情况,这条路径能否转化为收入,暂时还无法判断。
发布潮至少说明,本体性能已经无法单独承载公司的技术叙事。机器人要进入工厂、商场和家庭,客户最终购买的是完成任务的能力。
问题在于,发布模型和稳定完成任务之间,还隔着一套缺失的验收标准。
64项任务之后,还要回答三个问题
宇树公开的“64项任务”很直观。但现有材料没有说明每项任务的成功率、重复次数、失败样本以及统一测试协议,也缺少与竞品在相同条件下的对照。
64项任务可以展示模型覆盖面,还不能直接换算成64项稳定量产能力。
如果把机器人放进真实产业场景,至少需要回答三个问题。
第一个是任务成功率。
机器人连续执行100次,能成功多少次?环境发生轻微变化后,成功率会不会迅速下跌?发布视频里的单次完成,无法回答这些问题。任务前是否经过特定摆放,过程中是否存在人工干预,失败后是否重新拍摄,当前公开信息也没有完整说明。
第二个是失败恢复率。
松延动力的HERON-CRA把“从错误中学习”放在核心位置,这恰好击中了机器人落地的难点。真实任务不会永远按脚本运行:物体可能滑落,抓取位置可能偏移,行人会突然进入工作区域。
此时,机器人能否识别失败、重新规划并继续执行,往往比一次成功的演示更重要。现有材料尚未给出HERON-CRA的失败恢复率、连续运行时长和不同故障类型下的测试结果。
第三个是可复制性。
同一个模型换一台机器人、换一批设备、换一个客户现场,是否还能维持性能?机器人本体、摄像头视角和控制方式不同,都会增加迁移难度。实验室里的能力如果需要工程师长期驻场调试,交付成本就很难随订单规模下降。
这三个问题也决定数据能否真正形成闭环:部署产生失败案例,失败案例进入训练,更新后的模型再次回到现场验证。缺少统一测试协议和持续运行数据,数据规模便很难转化为客户可核验的能力。
10亿小时视频,仍要落回真机
具身模型遇到的另一个瓶颈,是机器人数据太少,也太贵。
真机采集需要设备、场地和人员。专项采集能够贴近目标任务,却难以覆盖足够多的环境和动作。于是,一批公司和研究团队开始从互联网视频中提取人类行为经验。
亮源新创2026年9月公开的Light-O1,使用规模超过10亿小时的互联网人类行为视频。其路线是先从视频中恢复结构化动作信息,再将人类动作、第一视角数据与机器人动作映射到统一空间,最后使用目标机器人数据做适配。
技术报告显示,Light-O1在RoboCasa GR-1的24项任务上取得79.3%的综合成功率,在超过3万条指令的人类盲评中获得1472.8 Elo。前者来自模拟基准,后者属于人类评价,两组数字不能与真机任务成功率或工厂验收率直接比较。
HumanScale研究也提供了一组实验结果。在相同预训练数据量下,使用第一人称人类视频预训练的模型,真实机器人动作预测验证损失降低24%;在该论文设定的真实机器人任务中,分布内和分布外成功率分别提高52.5%和90%。这些数字适用于特定模型、任务和实验条件,无法外推到所有机器人场景。
中国公司此前已经开始尝试类似路线。灵初在2026年4月披露,其预训练数据包括5417小时真机数据和95472小时人类数据,总量约10万小时。
人类视频由此成为新的预训练来源。它可以扩大动作和环境的覆盖范围,却没有让真机数据消失。
宇树仍然使用了约2500小时真机数据。Light-O1也需要目标机器人数据完成适配。不同身体结构能承受的力量、运动范围和控制精度并不相同。人可以轻松完成的动作,映射到机器人上可能无法直接执行。
“超过10亿小时”也只是视频规模,不等于经过清洗、标注后可用于控制训练的有效动作时长。版权授权、隐私保护、数据清洗和危险动作识别的成本,目前同样缺少完整披露。
人类经验解决的是预训练数据从哪里来。机器人到了客户现场能否稳定工作,仍要靠目标本体适配、场景数据和反复验证。
发布速度之外,还有一只更慢的钟
这轮发布潮里,三家公司各有一道待完成的验收题。
宇树已经开放代码、权重和数据集,下一步要看64项任务能否被不同开发者、不同设备和不同环境复现。
智元同时推进感控一体与世界—动作模型,下一步要看两条路线能否转化为跨产品、跨场景的稳定成功率。
松延动力强调环境推演和错误学习,下一步需要用失败恢复率与连续运行数据,证明机器人能够把错误变成后续能力。
9月的发布日程走得很快,产业现场的验证时钟却慢得多。
任务成功率、失败恢复率和可复制性都需要长时间测试,也需要披露失败。谁先发布模型,只能决定谁先进入视野。谁能把模型放进具体场景,记录失败、更新能力,再在下一批设备和下一个客户现场复现结果,才有机会把“大脑”变成可验证的壁垒。
机器人考试已经换了科目。及格线不能再由演示视频和参数表单独决定。
![]()
技术的意义,不只是让机器更聪明,而是让人拥有更多可能。12月26日,“AI闪耀中国·2026吴晓波科技人文秀”,欢迎你与我们一起,共赴智能时代。


