没去过你家,也不耽误帮你叠被子。
9 月 17 日,人形机器人公司 Figure 放出新一代模型 Helix 2.5。测试场地是 30 个真实的湾区民宅。这些房子它此前没见过。也没人提前采过数据。

很多人看完视频的第一反应是平淡。「不就是叠毛巾和铺床,顺手捡点东西。」
这些动作确实早就见过。可过去的演示大多在实验室,或者精心布置的演示房。这一次,机器人是直接搬进 30 个从未打过交道的家。屋里的物件陌生,房间布局陌生。数据采集一次没做。针对性微调也没做。

420 次试验里成功 237 次。零样本成功率 56%。评测走了盲测流程。任何一个单项任务,在预训练数据里的占比都没超过 1.90%。
对照组更能说明问题。同一台硬件,同一批任务数据。只是拿掉预训练,成功率只有 9%。
与上一代放在一起看,差别更清楚。今年 1 月的 Helix 02 也能干卸洗碗机这种几十步的长活。但它得先在目标场地采一遍数据。新模型只用一半的适应数据量,就在 30 个从没进过的家里,追平了上一代在单一场地的成绩。

这次真的不一样吗
家用机器人被寄予厚望,已经半个多世纪。
动画片《杰森一家》里有个机器人管家叫 Rosey。围裙和拖把一应俱全,做饭、铺床样样能干。

它影响了后来几十年的机器人设计。到了七十年代和八十年代,冒出来的除了更高的期待,还有一批投机公司。新泽西有家公司叫 Quasar。它承诺过家用机器人 Klatu。可宣传里一半的活,它都干不了。打扫和修草坪费劲,连遛狗都费劲。公司照样宣称自己迈进了未来。

半个世纪过去,叙事又走到同一个路口。
对人来说,换一张床不至于忘了怎么铺被子。对机器人来说,床的高度变了。墙边的空隙变了。被角垂下来的位置也变了。熟悉的动作就可能瞬间失效。
如果每进一个家庭都要有人先采示范,再回头调模型,那机器人卖出去那天,训练才刚刚开始。
这也是过去几年那些看起来很厉害的家用演示共同的短板。特斯拉的 Optimus 是这样。1X 的 Neo 也一样。它们都离不开大量场地专属数据,或者人工远程接管。
新模型想回答的问题更难。机器人能不能走进一个从没见过的家,直接开始干活,不用主人先配合录一遍自己家的样子。
Figure 在评测前做了件麻烦事。要用的毛巾和玩具,加上床品,被单独挑出来存放。先由一个模型初筛,再人工复核。确认它们没在任何任务训练数据里出现过。30 个住宅保留了原本的沙发和折叠台面。没有为评测做改造。

公司负责人 Adcock 说,这是「我们迄今做过最重要的项目」。他和 AI 负责人都在发布视频里强调,30 个家庭「每一个都记录到了成功」。

机器人先向人类借一点经验
撑起这次变化的,是 Index 这套数据集。
它看起来更像一门数据采集生意。今年 5 月,公司用另一款应用的形式低调上线了采集入口。8 月 25 日,它才正式以 Index 之名公开。公司的说法是,这是他们做过最大、最多样的机器人训练数据集。

公布的数字不小。上线时下载 26.4 万次,覆盖 108 个国家。每周有超过 4.4 万名创作者活跃,累计上传视频超过 1600 万条。上传速度一度达到每秒 30 分钟的新视频。那相当于每天有 4.9 年的人类工作量涌进系统。到 9 月初,这个速度提到了每秒 35 分钟。

代价也明码标价。公司已经向创作者支付 1500 万美元。未来 12 个月,还计划再投 10 亿美元以上,用于数据和算力。采集规模要扩大 100 倍。
每 1000 小时的数据里,装着 373 个不重复任务。另有 1146 个不重复对象和 116 个不重复环境。这些素材还要过五道工序。先筛选。再做反作弊和去重。接着分布再平衡。最后补文字标注。

拿它比早期互联网语料对大语言模型,多少有点那个意思。人类的日常动作,有机会成为机器人的基础教材。过去要在某一处场地反复收集的经验,或许能被提前学到,再带进下一个环境。
数据量的作用也看得见。预训练数据翻倍,动作预测误差规律性下降。这条曲线很平滑。拿小规模实验的结果,就能预测最大规模训练的损失值。偏差只占整体波动范围的 0.54%。公司管它叫缩放定律。

这条路子和 AI编程 的演进很像。先在海量数据上预训练。再用少量任务数据做适配。宁可前面多花算力,也不要为每一个新家庭单独派人重采一遍。
同行也在找扩大经验来源的办法。1X 的 Neo 今年 2 月开始面向家庭预订,售价 2 万美元。但从冰箱里取水,需要接管。往洗碗机里放餐具,需要接管。叠一件毛衣也一样。这类动作背后,是公司内部代号 Turing 的远程操作员,戴着 VR 设备实时接手。

1X 把这些接管数据和家庭日常视频一起喂给年初发布的世界模型,指望逐步降低对人工的依赖。特斯拉那边更依赖大规模人类遥操作。操作员戴着传感设备完成分拣、使用电动工具的动作,再把轨迹交给网络去模仿。
相比之下,Figure 走的是另一条路。先让模型从海量人类视频里学一般性的行为模式,再用少量任务数据适配到具体动作上。

叠毛巾之后,还有真实生活
叠毛巾看着无聊,是因为我们太熟悉了。研究者关心的是泛化能力。屏幕前的人只看见毛巾又叠好了一条。
我个人唯一失望的是任务太少,只有三个。我希望看到擦拭镜子,整理食物,做饭。
如果把这三个任务扩到十到十二个。再把零样本成功率提到 80% 到 90%。那离买回家就能用就不远了。到那天,也不用先采自己家的数据。

56% 也不是说机器人永远失败。长时间任务里,它已经能自己修正和重试。就像小孩学铺床,得试好几次才顺手。
另一层麻烦在于,租来的住宅提供了不同布局,却未必涵盖日常的全部混乱。地毯上的乐高,沙发缝里的充电线,孩子临时堆起的玩具,都可能把原本走得通的路线堵死。让主人先替机器人收拾一遍,显然不符合买它的初衷。

资源也在为更大的训练铺路。9 月初,云计算公司 Nscale 宣布向 Figure 提供至少 35 亿美元的算力。双方计划把规模扩到 60 亿美元以上。最多部署 10 万块英伟达 Vera Rubin 芯片。首批设备预计 2027 年下半年在得州巴斯托落地。作为交易的一部分,Nscale 入股 Figure,成为它的优先算力供应商。

Adcock 在声明里说,人形机器人要送进全世界的每一个家庭。眼下最大的瓶颈,就是数据和算力。
人形机器人算得上最复杂的一类 AI工具。Index 还在为它们大规模收集人类经验。数据量继续涨,迁移效果还会有可预见的提升。真正值得盯的是另一件事。再完成几轮更大规模的训练,面对更庞大的任务集合之后,56% 这个数字能被推到多高。
