旧金山湾区的30套出租屋,最近被一家叫Figure的机器人公司租了下来,不为住人,专门用来考机器人。9月17日,这家公司发布神经网络模型Helix 2.5,把机器人挨家挨户送了进去。

考的是三件家常活。铺床算基础的,收拾客厅要把散落一地的玩具逐件捡进篮子,叠毛巾最考验手感,布料软,抓重一点就容易变形。规矩定得死,机器人此前没进过这些房子,公司也没为它们采过一条新数据,进了门就得直接开工。评分按整件事做完算,收拾玩具那一项,13到15件少捡一件都不行。
成绩单已经贴出来了。420次完整试验做成了237次,总成功率56%。分开看更有意思,铺床最稳,140次里成了94次,叠毛巾62%,收拾玩具最吃力,只有40%。干错了也不僵在原地,官方视频里机器人会退两步换个站位,毛巾叠歪了会绕到床的另一边重新来。

进步的底子是叫Index的人类行为数据集。模型先从大量人类做家务的画面里学经验,再把这套经验直接搬进没见过的房子。对照组很说明问题,同样任务换成没有Index预训练的版本,成功率只有9%。这次每个任务用的专项数据只相当于过去的一半,适用的房子却一口气多了30倍。
官方把Helix 2.5称作公司迄今最先进的神经网络,能力定位在把人类经验迁移到陌生环境这件事上。数据集的盘子还在滚,按官方说法,Index每一秒钟就新增35分钟的人类操作画面,公司往Helix的训练里压了35亿美元的算力。
泼冷水的人也有。Sunday Robotics的Tony Zhao把账摊开算过,56%意味着差不多一半的试验是失败的,他家的叠衣模型ACT-2报出过99.1%的成绩。两边统计口径并不一样,一个按整套任务算,一个按单件衣服算,硬比高低意义不大。CEO布雷特·阿德科克把将近4小时的加长实拍也放了出来,想看真机表现的可以直接去翻原片。机器人什么时候能真正进寻常人家,官方没给时间表。
