机器人不缺身体了,卡住的是那颗会自己拿主意的大脑

一个平台上有四万四千人,正在教机器人过日子。

他们把每天做的事拍成视频,再上传给机器人学。

Figure 的 Index 数据平台公告卡片

图注:那张公告卡片上写着,要建全球最大也最多样的物理数据集。

三个月里,一百多个国家的用户传了上千万条视频。

平台每秒收到三十分钟新内容,相当于每天记下四年的工作量。

一位机器人学习学者的播客访谈视频封面

图注:一段播客访谈的视频封面,麦克风品牌的标识清晰可见。

钱也砸得很足。

这些「老师」已经拿到一千五百万美元,往后一年还准备在数据和算力上投十亿美元以上。

可是身体早就够用了。

那台机器人会后空翻,能跑酷,也能跳过障碍。

真让它从桌上拿一只咖啡杯,它反而犯了难。

几天前的世界机器人大会上,宇树创始人王兴兴谈过行业的「聊天机器人时刻」。

他估计真正的突破还要等两三年,不顺利的话,就是五到十年。

机器到底还缺什么,才敢从演示走到量产。

一位机器人学习学者最近在播客里,把这件事讲得比较透。

他在美国一所大学任教,也联合创办了一家机器人公司,是这个方向上被引用最多的研究者之一。

身体先熟,脑子后熟

在模型接管机器人研究以前,波士顿动力几乎就是先进机器人的代名词。

那台机器人后空翻和跑酷的视频,一次次刷屏。

这两年,它不再像过去那样占住舆论中心。

这位学者给了一个解释。

机器人是一门拼系统的学问。

电路怎么连,用哪种能源,执行器怎么设计,一直到高层怎么规划,都是同一套系统里的事。

一家公司发一段演示,外人常常分不清它到底强在哪一层。

波士顿动力的很多经典成果,展示的是极出色的硬件和老练的控制方法。

他们有很棒的控制工程师,能把整台机器调得很稳,却较少碰决策这一层。

在某个阶段,这个选择很合理。

身体都造不出来,谈装什么脑子没有意义。

现在情况变了。

硬件还有改进余地,但许多方面已经「足够好」。

眼下最难的,是搭起一套真正管用的决策循环,让机器对周围发生的一切做出聪明的反应。

这里说的决策,不一定指高层规划。

它可能非常底层。

空翻的时候,机器主要对付自己的身体。

伸手去拿杯子,看着比空翻简单,它却必须弄明白外面正在发生什么。

只盯着自己是不够的。

一条分界线在这里出现。

控制系统管身体,模型管身体以外的世界。

机器人既没有数据矿山,也没有撤回键

有人给主持人算过一笔账。

今年上半年,国产人形机器人出货超过四万台,占了全球的绝大部分。

可整个行业攒下的真实操作数据,大概只有十万小时。

训练一套机器人基础模型,这点量远远不够。

这位学者提到,眼下机器人研究用到的大量硬件来自中国。

质量不错,价格也合适,能达到研究需要的标准。

真正没解决的,是软件和数据的规模化。

模型走进物理世界以后,两样东西同时丢了。

一样是随手就能下载的互联网数据。

另一样是随时可以推翻重来的低成本环境。

主持人问,如果一家头部模型公司大举投机器人,同行会不会紧张。

他说,机器人领域的生态,可能还没有机器学习的其他分支健康。

计算机视觉和自然语言处理天生适合长出以模型为核心的生态。

它们的数据能自由获取,学界也早就接受用学习的方法。

安全上的顾虑也没那么重。

人们有理由担心模型的安全,可那和一台铁疙瘩直接撞伤人不是一回事。

机器人学界传统上并不爱共享数据。

围绕机器人学习做的事越多,大家的想法越可能转向另一边。

大家开始接受,机器人该由学出来的模型来管,而不是靠人手调的控制器。

数据会变得很多,也必须被共享。

没有哪一家机构能只守着一个垂直场景,独自攒出真正的基础模型。

他也承认,光靠一家公司推不动这种转向。

聊天机器人用起来不是这样。

第一句不太对,你改改提示词,再问一遍就行。

早年的聊天机器人远没有今天强,也已经能派上用场。

用户可以反复试,调到它基本能办事为止。

这和用搜索引擎差不多。

换个问法再搜一次,总能找到想要的信息。

所以我们平时用 AI对话,容错空间很大。

机器不行。

它的全部价值,只有在能自己把活干完时才会放出来。

每做一件事都得有人守在旁边反复指点,那就违背了用它的初衷。

所以最大的风险是,它到底能不能达到实际应用要的可靠度。

先验知识,是他这几年最想强调的一件事。

主持人请他想一条建议,给刚入行的自己。

他说,这几年他想明白一件和早年不一样的事。

要解开机器人问题,得用上非常广的先验知识。

很多人一度相信另一种说法。

既然人能从头学,机器也行。

早年在谷歌做大规模机器人学习时,他们搞过一个「机械臂农场」。

一间会议室里摆满机械臂,让它们不停抓东西。

想法是抓过几百万个物体,就能学会一套通用的抓取策略。

这套办法基本奏效。

机械臂确实学会了抓各种东西。

再往前一步就很难。

能抓东西了,然后呢。

这份能力并没有变成学更复杂技能的地基。

一部分原因,是当时完全走了白板的路子。

一切从零开始,看机器能不能在没有任何先验知识的情况下,自己长出各种行为。

换个思路,把机器的亲身体验和别处的知识接上,事情会容易得多,也现实得多。

关键从来不是语言。

关键是能不能拿到先验知识,再拿它给学习搭脚手架。

这类知识有很多来源。

人不全靠语言,动物更不是。

人和动物还会看别人做事,照着学。

要是接不上这些来源,等于要求机器去解一道比人和动物更难的问题。

让一个人组装家具,但他一辈子没见过任何家具。

这事当然很难。

他甚至不知道自己为什么要拼,也不知道拼完该长什么样。

所以先验知识很重要。

他依然支持让机器从亲身体验里学。

只是会补一句,对先验知识,要再认真一点。

先找对值得放大的东西

行业里已经冒出三种攒经验的做法。

一家美国公司动员一百多个国家的普通用户,记录家里和店里、办公室和工厂里的真实任务。

另一家打算让产线工人戴上传感器,用两年收集数千万小时的动作数据。

还有一家建起百万小时的数据池,让视频预测和机器动作互相训练。

可数据更多,不必然等于本事更强。

这位学者反复强调,规模化要成立,前提是先找对技术和数据。

机器人还没进入那种「堆资源就变强」的稳定阶段。

大家在找的是真正能被放大的杠杆。

他拿语言模型举过例子。

最初那批模型用的是老式循环架构。

它表现还行,也远超此前的方法,可扩展性不好。

后来那套注意力架构真正厉害的地方,不在数学上多漂亮,而在它更好放大。

人们能用海量数据和极多参数去训它。

一项技术通常分几步走。

先弄清什么能被规模化,找到可扩展的技术。

再投入工业级资源,堆数据,放大模型。

某种「魔法」这时候才冒出来。

所以做底层研发时,关键是找到能撬动规模的那根杠杆。

选对架构,配出大致合适的要素。

这些做完也许已经能做出很酷的东西,可它还不足以改变世界。

只有持续拉动规模化这根杠杆,事情才会真的变。

回到机器人的问题。

它现在还在确立基础技术的阶段。

所以不该指望机器人模型每个月都变得更大更强,沿着一条可预测的曲线往上走。

随着正确的技术被找出来,它的缩放规律本身也在变。

拼图正在一块块归位,看上去离完整已经不远。

也正因为这样,接下来往哪走仍然难猜。

主持人提过一个诱人的想法。

最先实现规模化的实验室,可能最先取得突破。

部署的机器人越多,发展越快,发展越快又越容易铺开,最后转成一个加速的数据飞轮。

他说这个说法大体成立,但有个细节必须盯住。

得把对的东西规模化。

真正的关键,是建立一个有效的正反馈。

铺得越多,能力越强。

难的地方在于,人们很容易用错的方式去造这个飞轮。

假设他经营一家汽车公司。

产线上有一条机械臂负责焊接。

它每天干活,一个月能焊上百万次。

要是只把这些记录当成飞轮,最后得到的,多半还是一台更会焊接的机器。

可这台机器本来就在产线上,本来就会焊。

在它身上再多挤出一点提升,价值有限。

这就是为什么对象必须选对。

数据不是一种可以随手替换的标准商品。

它不像电,也不像油,不是买得越多越好。

机器要的是有差异、够多样的数据。

飞轮的方向没错。

但技术要对,放大的对象要对,数据来源还得撑得起这种多样。

对机器来说,数据更像一套课程,而不是能囤起来的货。

不是造一个「机械人类」

主持人请他给一条路线,从现在到机器走进家门替人干活,中间有哪些关键节点。

他说,机器人最难的部分,始终是泛化。

一家公司展示系统时,光看一段演示,很难判断泛化到底有多强。

机器做出一套高难度特技,看着当然过瘾。

这类内容往往带着编排。

它和机器在随便哪户人家里每次都能可靠干活,不是一回事。

单看一次,泛化通常并不惊艳。

它是很多次试验才显出来的特征,一次演示撑不满。

你看到的,可能只是机器在做一件很平常的事。

真正让人兴奋的是这一层。

它用的东西从没见过,待的地方也从未测过。

这比做一套练过百万遍的后空翻难得多。

路线图的第一件事,是拿到更强的泛化。

第二件事是一种二阶效果。

机器泛化得越好,就越容易变得更强。

这条路上有一个关键节点。

非常明确地证明,机器进到一个训练时从未碰过的环境,能靠自主攒下的经验持续进步。

比如先在实验室里做完前期工作,拿到一个模型和一套适应算法。

再把它放进新环境,可能是一户人家,也可能是一座工厂。

头几天它的表现只是勉强过得去。

随着时间推移,它会一点点变好,最后达到实际应用要的可靠度,而不是涨到一半就顶住。

这说明整套过程真的自动化了。

机器一边攒有用的经验,一边改自己。

另一个关键节点,是找到一套明确又实用的办法,在不同场景之间搬知识和常识。

开车在路上,前面突然出现一辆消防车和一排路锥。

就算你从没遇到过,常识也会让你松油门。

你可能不知道最优解,但至少不会径直冲过去,耽误别人干活。

这就是常识。

机器要是也能靠常识从意外里恢复,那会很要紧。

锅铲被它顺手塞进了烤箱。

从语义上讲,它该知道这不是锅铲该待的地方。

于是它重新拉开烤箱,把锅铲拿出来。

能做到这一步,就说明常识可以用来纠错。

主持人最后问了一个更大的问题。

假设十年后,模型和机器都强得吓人,终点会不会是终结人类劳动。

他说,把机器想成「机械人类」是个错误。

从某种角度说,计算机有点像「机械大脑」。

可上世纪九十年代个人电脑普及时,先发生的并不是人们拿电脑替换自己的大脑。

先发生的是各种形态的计算机一起涌出来。

桌上有一台,口袋里可能也有一台,冰箱里可能有,车里也可能有。

计算变得太容易拿到,于是什么东西里都能塞一点。

最早琢磨计算机的那些人,大概想不到这个结局。

他们想的可能是占满整间屋子的巨机,替一个国家定政策。

不会想到每个人的冰箱里都有一点算力。

顺着这个比方,未来可能是「什么东西里都有一点动手能力」。

许多今天得亲自做的琐事,往后都能分到一点自动化帮忙。

另一个可以参照的例子,是现在的 AI编程助手。

它最后会走到哪里,眼下也没有定论。

可从软件工程师眼下的感受看,更多人觉得它放大了自己的能力,而不是让自己慌。

当然也会有人慌。

至少从这位学者接触过的同行,以及他自己的体验看,用 AI工具扩大一个人能完成的工作量,更像是能力变强。

这个比方还算贴切。

软件工程是一份真实存在的工作。

模型已经进了这个行当,也给从业者加了杠杆。

真实结果怎样,还得等时间给出。

不过有一点他讲得很明白。

眼下这个阶段,该问的不是机器什么时候超过人。

该问的是,它得先学会哪几件不起眼的小事。