Figure租了30套房,让机器人挨家“考核家务”
来源:36kr 5 小时前

当地时间9月17日,人形机器人公司Figure发布神经网络模型Helix 2.5,并公布了一组零样本全身自主实验结果:在没有任何新数据采集与环境适配的情况下,机器人的零样本成功率从9%暴增至56%。

Figure创始人兼CEO布雷特·阿德科克(Brett Adcock)表示,公司租下旧金山湾区的30套住宅,让Helix 2.5在不采集新数据、不额外训练、也不做环境适配的前提下直接执行任务。Figure要回答的是:机器人能否进入从未见过的家庭,直接开始做家务?

官方博客将Helix 2.5称为Figure迄今最先进的神经网络,旨在验证人形机器人能否仅凭已有知识,在未经微调的环境中自主完成长时程任务。

人类能走进陌生房屋并立即投入工作,是因为对物理世界的认知具备跨环境迁移能力,无需因床高或家具布局变化重新学习。传统机器人通常依赖在具体环境中采集数据并做针对性训练。Figure希望打破这一范式:先让机器人从大规模人类行为经验中学习,再将其通用能力直接迁移到陌生真实环境。

01 租30套房,不采数据,直接干活

在官方演示中,Figure 03人形机器人进入一套完全陌生的房子,连续完成三项长时程全身任务:整理客厅、铺床、折毛巾。

Helix 2.5在真实家庭中完成整理客厅、狭窄空间穿行铺床与折毛巾三项全身移动操纵任务

整理客厅时,散落各处的玩具被机器人逐一捡起放入篮子。阿德科克在相关视频和帖子中强调,机器人此前从未进入这些房间,公司没有为这些新环境采集数据。机器人需要一边移动、一边寻找目标物体、调整身体姿态,再完成抓取和放置。

铺床任务更难。机器人从未进过这个房间,从未见过这张床,也从未见过这些床上用品。它必须抓起枕头、拉动被子,把相关物体移动到指定位置,并将被子拉平。折毛巾则被Figure用来测试对可变形物体的操作能力:机器人需要抓起此前没有见过的毛巾,完成折叠,再将其放入篮子。

这三项任务在不同陌生家庭中结合了主动感知、移动与操纵

Figure表示,Helix 2.5是公司构建过的最先进神经网络。一个经过Index预训练的基础模型被用于三个不同任务,覆盖移动、刚性与可变形物体操作、双手协调以及主动感知。

这些任务之所以被选中,是因为它们要求同时解决多个经典机器人问题:感知、移动、操纵、双手协调以及全身控制,而且必须实时完成。大部分机器人泛化研究都建立在围绕机器建造的环境中,例如桌面机械臂局限于固定工作空间,轮式机器人则需要足够开阔的地面供底盘移动和转向。但家庭环境不会配合机器人,人形机器人必须让自己的身体成为任务的一部分,在狭窄、杂乱的空间中移动、观察、伸手和操纵物体。

这里还有一个需要特别说明的概念:Figure所说的“零样本”,主要针对评估环境和被操作物体。30套评估住宅此前没有采集数据,评估使用的玩具、毛巾和床上用品也没有出现在任务指定数据中。机器人直接使用各个陌生家庭中的沙发、床和折叠毛巾完成任务。

换句话说,Helix 2.5并不是完全没有接受过“整理客厅、铺床、折毛巾”的任务训练。三个行为本身经过了在其他环境采集的任务指定数据适配,Figure真正想验证的是:这些已经学会的行为,能否在从未见过的住宅和物体上直接泛化,而不需要到了现场再重新训练。

评估标准极其苛刻:整理客厅要求把13至15个玩具全部收好,折毛巾要求完整折叠入篮,铺床要求枕头与被角拉至床顶三分之一并平整。任务要求端到端完全成功,不提供任何部分得分;每个任务均使用同一个固定模型节点(测试版本),不针对新环境调整模型参数;过程只要出现一次人类安全干预,便直接判定失败。

为零样本评估将场景重置为无控制初始条件的示例

Figure表示,它将Helix 2.5部署到30套此前没有进入过的湾区住宅。每次试验开始前,评估物体都会被提前放置,并由AI模型结合人工审核确认这些物体没有出现在任务指定数据中。每一次试验还使用独立的初始配置,并对所有被评估策略采用相同的重置条件,以保证比较公平。

在试验层面,官方博客给出的关键数据是:零样本成功率从9%提升到56%,即提升至原来的6倍以上。这里的“成功”指完整任务成功,而不是完成其中一部分。

02 Index预训练,人类经验是机器人的“漏洞”

Helix 2.5的关键不只是模型,而是它背后的Index。

Figure的逻辑很简单:大语言模型之所以能够不断扩大能力,一个重要原因是互联网提供了海量人类数据,使预训练能够随着数据和算力规模扩大而持续获得收益。但机器人没有互联网规模的行为数据。Figure因此试图建立一个大规模的人类行为数据集Index,让机器人先从人类如何在真实世界中行动、抓取和操纵物体的经验中学习。

Figure在此前关于Index的介绍中,将其定位为全球规模的人类行为数据集。Helix 2.5则进一步验证:这些人类经验能否转化成真正的机器人行为能力。

Figure表示,目前Index每秒能够产生约35分钟的新的人类经验数据。与此同时,公司已经承诺投入35亿美元算力训练Helix。

最关键的问题是:这些人类经验,真的能转化为机器人行为吗?

Figure做了一组控制实验:两个模型使用完全相同的任务指定数据,架构、优化方式、超参数、下游数据和评估方法全部保持一致,唯一变量就是是否进行了 Index预训练。

实验对比了两个模型:一个是从零开始随机初始化权重的基线模型,另一个则是先经过Index海量数据预训练的Helix 2.5模型。Helix 2.5本身完全是从随机权重开始、仅依靠Index数据完成预训练的,这与上一代Helix 02截然不同。Helix 02当初是基于现成的预训练视觉语言模型进行初始化的。

30套家庭中的零样本成功率对比(从头训练模型vs基于Index预训练模型)

结果非常明显。没有Index预训练的策略,零样本成功率只有9%;加入Index预训练后,成功率达到56%,超过前者6倍。由于预训练是唯一的实验变量,Figure认为,这一差距可以直接衡量Index预训练对零样本能力的贡献。

而且,Index的训练数据并不是专门围绕这三个测试任务构建的。Figure表示,没有任何一个评估任务占Index预训练数据的比例超过1.90%。这意味着模型获得的预训练经验并不是简单地“反复学习如何折毛巾、铺床和收玩具”,而是试图从更加广泛的人类行为中形成可迁移的能力。

Helix 2.5与一个执行相同任务的Helix 02进行比较

数据效率同样发生变化。Figure将Helix 2.5与一个执行相同任务的Helix 02策略进行比较:后者使用在实际评估环境中直接采集的数据,而Helix 2.5 在达到相当成功率的情况下,只需要一半的适应数据,并进一步将行为泛化到30套此前没有见过的住宅。

Figure因此将这一结果概括为:行为指定成本降低2倍,同时部署范围扩大30倍。

另一个值得关注的变化,是Helix 2.5的全身自我纠错能力。在长时程任务中,机器人并非每一步都能一次完成。如果抓取或者折叠出现偏差,它可能后退重新定位、改变站姿,甚至绕到整张床的另一侧继续完成任务。Figure将这种“犯错后恢复并继续推进”的能力,视为Index预训练带来的重要效果之一。

更长远看,Figure还报告了一条“人类到人形机器人”的迁移缩放定律。团队在Index的嵌套子集上训练四个模型,预训练数据规模逐步扩大,最大跨度达到 8 倍,同时保持模型规模和下游训练不变。实验结果显示,随着 Index 数据量的每次翻倍,下游机器人对下一步动作预测的损失值(loss),均呈现出平滑且可预测的下降趋势。

人类到人形机器人的迁移缩放定律图表

更为关键的是,这种下降趋势展现出极高的可预测性。Figure 表示,仅凭较小数据量训练得出的测试结果,便能在最大规模模型训练启动前,精准预测出其测试损失值至小数点后四位,预测误差仅占完整8倍数据量变化范围的0.54%。

Figure称,这是首次在人形机器人上测量“人类到机器人迁移缩放定律”。它意味着,一个此前主要存在于大语言模型领域的思路,通过扩大预训练数据规模,预测未来模型能力的提升,可能也能够延伸到人形机器人。

当然,这里测量的只是数据规模的缩放关系,模型规模和下游训练都保持不变。因此,它还不能直接证明“机器人模型越大就一定越强”,但至少说明:在当前实验中,增加人类经验数据与机器人动作预测能力之间存在可预测关系。

03 重新划定“学习”与“部署”的边界

从Helix02到Helix 2.5,Figure实际上在改变一个前提:机器人不必每进入一个新地方,就重新学习一次。

Helix 02曾展示全身长时程控制能力,从卸洗碗机到自主运行200小时物流任务,但这些系统学习的数据来自机器人将要运行的地方。Helix 2.5则试图证明:全身智能可以从人类经验中学习,并迁移到新场景,而不是每次进入一个新环境后重新建立。

这也是Helix 2.5与此前机器人系统之间真正值得关注的差别。

传统机器人的数据闭环往往是“机器人进入环境采集数据,训练模型,再进入环境”。这种方式可以不断提高单一场景中的表现,但如果机器人最终要进入千家万户,就意味着每一个家庭都可能成为一个新的数据采集和训练对象。

Figure想建立的则是另一条路径:人类先在现实世界中积累经验,Index将经验规模化,Helix 2.5从人类经验中预训练,机器人把行为知识带到陌生环境中。

如果这一模式继续成立,那么机器人数据的来源就不再局限于机器人本身。人类已经在现实世界中积累了数百万年的物理交互经验,而Figure想做的是把其中一部分转化为机器可以学习的训练数据。

Figure在官方博客中也明确强调,这并不意味着通用人形机器人问题已经被解决。它认为,Helix 2.5提供的只是第一个证据:全身智能可以从人类经验中学习,并转移到新的场景,而不需要每次重新构建。

Figure给出的结论非常直接:如果Helix 2.5验证了这套逻辑,那么未来投入更多的数据与算力,就能让机器人在踏入任何新家庭之前,预先掌握更多关于物理世界的认知。

正如阿德科克在官方视频结尾时所说:“是时候扩大规模了(It’s time to scale up)。”当预训练汲取自海量的人类经验,部署应用在陌生的真实家庭,具身智能的边界正被重新定义:机器人不必每到一个新家就重学一遍,而是先向人类学习,再通往千家万户。

简体中文 English