10亿级预算、百万小时数据狂欢:具身离「开箱即用」还有多远
来源:36kr 8 小时前

2026年,具身智能行业最高频的关键目标,毫无疑问是“百万小时数据”。

1月,鹿明机器人预计年内建成超过100万小时的UMI数据采集产能;5月,灵初智能把达到100万小时的时间定在年底;北京人形机器人创新中心的数据基地也提出,要迈向“全球首个百万小时高质量数据”的目标。到了6月,星海图又联合北京亦庄启动“100万小时超高质量真实数据计划”,规划当年完成百万小时,未来三年走向千万小时。

ChatGPT的发展让scaling law成为AI行业过去几年最核心的经验之一。随着数据量、模型参数以及算力增加,模型能力也在提高,有时还会涌现过去没有的能力。如今,相同的期待落到了机器人身上。

既然语言模型可以从海量Token中学会写作、编程和推理,那机器人也能从海量数据中学会收拾房间、整理货架,甚至适应一个从未学习过的任务。

尽管“100万小时”缺乏精准的来源,它更像是具身智能行业在下一个数量级上的默契,背后是对scaling law的集体押注

一位大型互联网公司具身模型负责人告诉我们,这个规模是参考了GPT3时期OpenAI训练的语料规模。如果将100万小时的视频数据转换成token,由于视觉包含的信息密度低于语言,因此算上其中的折损折扣,他们倾向认为这个规模的数据量大致相当于GPT-3时期。

因此行业认为在「百万小时数据」这个尺度下,具身智能通过对数据的学习,有可能涌现能对标GPT3/GPT3.5的能力。

机器人能不能复现大语言模型的scaling law?100万小时能不能带来具身智能的“ChatGPT时刻”?

这期咱们从这100万小时的构成说起。

一、机器人数据,正在「摆脱」机器人

要让机器人学会叠衣服,最直接的办法,是让它「亲自」反复练习——操作员通过遥操作设备控制机械臂,摄像头记录机器人看到的画面,系统同时保存动作指令、关节状态和执行结果。积累到一定数量后,机器人回到相同的桌子前,面对差不多的衣物,通常能做出一个不错的Demo。

这类真机数据由目标机器人采集,机械臂的关节范围、夹爪结构和控制方式都已经体现在动作轨迹里。模型学会以后,不需要再做太多转换,就能用于控制。

一位具身数据公司的负责人告诉机研所,在环境固定、任务单一的情况下,几十到几百条高质量演示数据就能训练出不错的策略。但这类数据往往只能覆盖很窄的任务范围。

实验室里可能只学会叠一种衣服,换到家庭场景就要面对不同材质和形态的衣物,一旦环境和任务变化,需要的数据量就会迅速增加。

真机数据很难在短时间内大量获得。谷歌在2022年发布RT-1时,用了13台机器人连续采集17个月,才积累了超过13万条演示,覆盖700多项任务。这在当时已经是少见的规模。

据机研所了解,当前市场真机数据采集的价格,大约在每小时1000元左右。

人工成本、采集效率、培训需求都是成本很难降低的原因。机器人完成一次任务后,物品都要重新摆回原位,才能开始下一轮操作。采集过程,还会遇到标定偏差、设备故障、硬件磨损和无效数据。

另一个问题是和硬件的强相关性。双臂机器人积累的经验,换到单臂机器人上未必适用;机械臂、夹爪或摄像头的位置发生变化,原有数据也要重新适配。

2023年,由谷歌DeepMind牵头的Open X-Embodiment项目,开始把不同实验室的机器人数据汇集到一起。全球34个实验室贡献了60个数据集,其中包括22种机器人本体和超过100万条真实轨迹。实验显示,模型吸收其他机器人积累的经验后,在多个平台上的迁移和泛化能力都有提升。

但是这些数据不能直接拿来控制一台新的机器人。不同机器人的臂长、关节数量、夹爪结构和控制方式依然不同。Open X-Embodiment扩大了模型可以借用的经验范围,并没有让不同本体的数据变得完全通用。

到2024年出现了新的采集办法,Universal Manipulation Interface 通用采集接口,简称「UMI」。

采集现场不再需要整台机器人,操作者只要拿着一只带有相机和位姿追踪功能的夹爪,就可以在家庭、餐厅或工厂里倒水、叠衣服、清洗餐具。系统记录画面的同时,也会保存夹爪的移动轨迹和开合状态,之后再把这些演示转化为机器人可以学习的数据。

在杯子摆放任务中,UMI团队每小时可以完成111条演示,对比使用遥操作机器人时,只能完成35条。采集者还可以带着设备在不同房间之间移动,不必每换一个场景就重新搬运和调试机器人。

除了采集效率,UMI数据的采集成本也大幅下降。

如果把设备、数据处理和标注全部算在内,UMI数据每小时的成本只需要400至650元。它记录的信息比普通视频完整,又不必一直占用整台机器人,因此很快成为具身智能公司扩充数据的一种重要方式。

不过,UMI仍然需要一套专用的夹爪设备。平行夹爪让人类演示更接近机器人的动作空间,同时也限制了可以采集的动作。人手可以灵活转动手腕、改变抓握方式,完成一些精细操作,这些动作并不都能用夹爪复现。

2024年10月,佐治亚理工学院等机构发布EgoMimic,进一步把采集工具简化成了Project Aria眼镜。采集者像平时一样用双手整理物品、抓取玩具或完成家务,系统再从第一视角画面中提取手部运动轨迹,并将人类演示与机器人数据放在一起训练。

第一视角数据的采集门槛更低。人类动作比机器人快得多,也不需要频繁调试机械设备。家庭、办公室和商店都可以成为采集现场。同样一小时里,模型能够看到更多操作,也能接触更多物体和环境变化。

但是这些视频离机器人的实际控制链路也更远。它能够记录人看到了什么、双手怎样移动,却不能直接提供机械臂的关节指令、夹爪状态和接触信息。因此EgoMimic通常是把人类演示与真机数据放在一起训练,并通过跨域对齐缩小两者之间的差距。这类数据的成本可以降到每小时300元左右。

发展到这一步,机器人训练数据已经不再只有真机轨迹。它既包括目标机器人亲自完成的动作,也包括其他机器人积累的经验、人类拿着夹爪完成的演示,以及从第一视角视频中提取的手部运动。不同数据能教给模型的内容并不相同。有些更接近底层控制,有些更适合补充任务知识和场景变化。

2024年10月发布的π0,把这些不同来源的数据放进了同一个基础模型框架。Physical Intelligence在训练中使用了8种机器人采集的数据,也引入了Open X-Embodiment数据集。模型从已经接受过互联网图文训练的视觉语言模型出发,在学习控制动作之前,已经获得了一部分对物体、语言和真实世界的理解。

2025年2月,π0进一步开放代码和模型权重。具身公司和研究团队可以直接从一个通用模型起步,再用自己的机器人数据完成微调。Physical Intelligence披露,在部分内部实验中,一些任务只需要1至20小时的目标平台数据便能完成适配。

所以,今天如果看到一家机器人公司宣布拥有“100万小时数据”,首先要弄清楚的是这些数据来自哪里。

它们可能由目标真机采集,也可能来自其他机器人、UMI设备或人类第一视角视频。不同来源的数据采集成本不同,包含的信息不同,对模型的作用也不相同。

只报出一个总量,很难判断模型究竟从中获得了多少能力。还需要知道这100万小时由哪些数据构成,各类数据分别承担什么作用,以及最后用了多少目标真机数据,才把模型学到的经验转化成一台具体机器人可以执行的动作。

二、10亿级数据预算,能换回什么?

按照之前的成本测算,如果100万小时全部采用带标注真机数据,成本将高达10亿元,全部采用UMI全流程数据,约为4亿至6.5亿元;如果全部使用Ego数据,成本只需要3亿元。

成本差异如此之大,本质上是在不同数据路线之间做选择:是押注“越贵越接近真实控制”的真机数据,还是相信“规模更大、覆盖更广”的Ego数据。这几乎是每一家机器人公司在训练基座模型时都必须面对的问题。

实际的模型训练通常也不会只使用一种数据。Ego和UMI数据可以低成本覆盖更多场景,真机数据则更接近最终控制。预算如何分配,要看这些数据被放在训练的哪个阶段,以及模型当时缺少什么能力。

2026年7月发布的Xiaomi-Robotics-1,把训练分成了预训练和后训练两个阶段。

预训练使用了10万小时UMI轨迹,覆盖家庭、商业、工业和户外的1700多个真实场景。小米先把这些轨迹切成片段,再由视觉语言模型自动描述夹爪和物体发生的状态变化,让模型从中学习较广泛的动作生成能力。

后训练使用的数据,包括7200多小时真机数据、筛选后的开源机器人数据和一部分高质量UMI数据。

其中,自采数据来自真实家庭,覆盖整理沙发、收拾鞋柜和归置厨具等任务。这一阶段需要把预训练获得的能力对齐到真实机器人,同时让模型从描述物体状态变化,转向理解自然语言指令并直接执行。

因此,10万小时UMI和7200多小时真机数据不能直接用来比较哪一种“效率更高”。UMI预训练扩大了模型接触过的环境和操作范围,真机及跨本体数据则处理具体机器人的动作执行问题。

两类数据进入模型的时间不同,承担的任务也不同。

小米披露,随着预训练数据和模型规模增加,模型的验证动作误差持续下降,后训练后的真机成功率也随之提高。在手机装箱、打印机补充耗材、洗衣机装衣和纸箱装货四项新任务中,平均每项补充不到10小时真机示范,整体成功率达到75%;示范增加到平均每项不到40小时后,整体成功率升至85%。

在小米的评测中可以看到,随着预训练数据规模增加,模型在新任务上的学习效率明显提升,需要补充的真机示范数据随之减少。

Physical Intelligence在π0.5中采用了另一种组合。它把网页多模态数据、在多个家庭环境中采集的机器人数据、不同本体的机器人数据,以及目标移动机器人的数据放在一起训练。

在Pi的评测中,拿掉网页多模态数据后,模型在训练分布内的成功率只从83%降至82%,面对训练中没有出现过的物体类别时,成功率则从94%降至74%。拿掉跨本体机器人数据后,两项成功率分别降至67%和49%;拿掉多环境机器人数据后,又分别降至57%和31%。如果同时去掉多环境和跨本体数据,训练中就只剩下约400小时目标移动机器人数据,模型也无法达到完整数据组合下的泛化表现。

这些结果说明,网页数据对识别未见物体的帮助更明显,跨本体和多环境机器人数据则同时影响熟悉场景和陌生场景中的执行表现。约400小时目标机器人数据提供了与部署本体直接对应的动作,但仅靠这些数据,还不足以让机器人进入一个没有见过的家庭后继续完成任务。

小米和π0.5采用了不同的训练方式,却指向了相似的结论。

小米把大规模UMI数据用于预训练,再通过真机和其他机器人数据完成后训练;π0.5则把网页、多环境、跨本体和目标机器人数据放在一起训练。前者显示,不同数据可以在不同训练阶段承担不同任务;后者进一步证明,多环境和跨本体数据带来的能力,不能被少量目标真机数据完全替代。

因此,10亿元应该买什么数据,并不是在真机、UMI和Ego数据之间选择唯一答案。低成本数据可以用来扩大任务和场景覆盖,目标真机数据则负责与具体硬件和控制系统对齐。

更重要的问题是,100万小时由哪些数据构成,各占多少比例,以及它们将被用于模型训练的哪个阶段。

合理的数据组合,可以提高100万小时的使用效率,但是有了100万小时之后,就真的能迎来具身的ChatGPT时刻吗?

三、Scaling已验证有效,为什么100万小时还不是临界点?

那么,什么才是具身机器人的“ChatGPT时刻”?

在2026年WAIC的论坛上,智元合伙人、觅蜂科技董事长兼CEO姚卯青给出了一个具体的定义:机器人能够在物理世界中“开箱即用”,完成日常任务,并按照开放式自然语言指令行动。

这意味着,机器人不再只会执行提前训练好的动作,也不需要工程师为每个新任务重新编程或采集大量数据。普通用户把它带进一个陌生家庭或工厂,它就能理解要求,并调用已经学会的能力处理眼前的问题。

100万小时能让机器人出现ChatGPT时刻吗?在回答这个问题之前还要回答另一个问题:扩大数据规模,是否真的能够让机器人模型持续变强?

2026年2月发布的EgoScale,对数据规模进行了直接的比较。研究团队使用带动作标注的第一视角人类视频训练模型,分别测试了1000、2000、4000、10000和20000小时数据的效果。随着数据增加,模型的验证损失持续下降,平均真机任务完成得分从0.30提高到0.71,在测试范围内没有出现明显饱和。

研究还发现,数据规模与验证损失之间呈现出接近对数线性的关系。也就是说,这些第一视角视频虽然不能直接提供机器人的关节指令,其中包含的人类动作经验仍然可以随着规模扩大,转化为更好的真机表现。

Genesis公布的GENE-26.5使用了超过20万小时数据,包括手套与触觉数据、第一视角视频、第三视角视频和机器人数据。在公司的闭环仿真评测中,扩大预训练数据提高了模型面对新任务时的零样本表现;在真实新任务中,更大的预训练规模也改善了少量数据微调的效果。

慕尼黑工业大学和MIT的研究人员在论文《Neural Scaling Laws in Robotics》中筛查了327篇机器人相关研究。在其中包含可量化Scaling实验的论文中,模型表现通常会随着数据量或模型规模增加而提高,这种变化整体上更符合幂律而非线性关系。

这些结果来自不同团队,使用的数据、机器人和评测方式也不相同,但它们都指向了同一个结论:在现有实验范围内,扩大数据规模通常可以降低模型损失、改善真机表现,并减少适配新任务所需的数据。

机器人领域的Scaling law已经有效。

接下来的问题是:如果数据继续增加,100万小时会不会恰好成为能力跃迁的临界点?

目前还没有足够证据支持这个判断。

首先,机器人数据的“小时”并不是一个标准化单位。EgoScale使用的2万多小时数据覆盖近万个场景、6000多项任务和4万多种物体;另一批相同时长的数据,也可能只是在少数固定工位上重复有限的动作。即使都是真机数据,不同机器人使用的相机、传感器、夹爪和动作表示也可能完全不同。

因此,小时数可以用来衡量采集规模和成本,却不能准确代表模型获得了多少有效经验。两家公司都拥有100万小时数据,并不意味着这些数据具有相同的多样性、控制信息和训练价值。

现有实验覆盖的规模也不足以确定百万小时附近是否存在临界点。

EgoScale验证的是1000至20000小时之间的增长趋势;Genesis虽然把数据扩大到20万小时以上,但实验中的数据、模型和算力也在同时变化,很难把能力提升全部归因于数据小时数。

更重要的是,一条持续上升的曲线只能说明模型正在逐步改善,不能证明它会在某个整数节点突然获得一种新的通用能力。

至少在现有公开信息中,还没有一项受控实验,在模型架构、数据构成和评测方式基本不变的情况下,把数据从10万、30万一路增加到100万小时,并观察到机器人恰好在这一位置从完成熟悉任务跃迁到开放环境中的“开箱即用”。

提前采集的100万小时仍然只是一批静态数据。采集场中的演示通常发生在经过设计的任务和环境中,物品会被重新摆放,失败后也可以从头开始。这些数据主要告诉机器人,在正常情况下,一件事应该怎样完成。

机器人进入真实环境以后,还会遇到杯子滑落、抽屉卡住、塑料袋缠住手指等情况。前一个动作留下的几厘米偏差,也可能影响后面整套操作。它不仅要会执行标准动作,还要判断哪里出了问题,决定继续尝试、改变抓法,还是请求人类接管。

错误的经验,可能比正确的示范更为重要。

这也是本届WAIC上一众具身行业大咖一致的判断:低成本人类数据可以扩大预训练规模,但机器人要持续进化,还需要把真实部署中的成功、失败、人工纠正和接管过程重新送回训练系统。

预先准备的数据决定模型的起点,部署后的数据回流则决定它能否走进真实世界

100万小时可以被看作机器人数据生产工业化的里程碑,但不是一条已经得到验证的能力临界线。

真正检验这个数字的,是第一批百万小时级模型进入复杂环境以后,能够完成多少没有专门训练过的任务,又能否处理失败、意外和环境变化。在这些结果出现之前,100万小时能不能带来具身机器人的“ChatGPT时刻”,仍然没有确定答案。

100万小时值得关注,但不必迷信。

过去,行业很难知道机器人数据继续扩大以后会发生什么,因为很少有人真的把数据做到这个规模。如今,十万小时、百万小时的计划陆续出现,过去只能推测的问题,终于可以用实际结果回答。

等第一批用百万小时数据训练的模型真正亮相,“数据不够”就不能再被笼统地用来解释一切。

哪些公司真正找到了把数据变成能力的方法,哪些只是把数字做大,谁在裸泳,届时都能看得一清二楚。

简体中文 English