9 月 24 日,灵初智能公开了最新的技术进展。主角是它的具身模型 Psi-R2.5,以及一套围绕数据质量的改进方案。
先看一处反常识的地方。官方放出的对照视频里,一组是人手操作,一组是机械手操作。
乍看像人先做了一遍,机器人照着学。
顺序恰恰相反。机械手那段才是真实记录,人手那段是模型根据它生成出来的。
要让机器人学人,这次却先从机器人的动作出发。

这背后是个很实际的问题。人类每天都在干活,这些经验怎么交到机器人手里,是眼下所有 AI工具 共有的难题。
上周 Figure 也碰了同一件事。它发布的 Helix 2.5 用人手行为数据集 Index 做预训练。完成三类家务任务适配后,机器人被带进 30 个没采过数据的家庭做测试。
两边关心的是同一个问题。从人类经验里学到的能力,能不能撑住一个全新的环境。
灵初追问得更细一层。人类数据进了模型,不等于人的操作经验就能被机器人直接拿去用。
中间缺的,是数据能不能对上。
一、配对才是重点
人和机械手都能拿起一瓶可乐。两段拿可乐的视频放在一起,看起来就够教机器人照着做了。
实际上不够。
人手和机械手长得不一样。关节结构不同,接触物体时的摩擦条件也不同。
再加上人手姿态估计本身就有误差。人能顺利完成的动作,转成机器人的关节运动之后,未必还能成功。
所以要让机器人看懂这是在拿可乐,和给它一份可以这样拿起可乐的动作数据,是两回事。
灵初把人和机器人执行类似任务、只在任务含义上对应的数据,叫作弱配对数据。
这个区分很关键。
它更想要的是另一种对应关系。除了人和机器人的本体不同,两边场景基本一致。动作还要逐帧对应。机器人一侧的动作,得能在真机上直接回放成功。
这就是强配对数据。
强配对强调的是对齐。它要的不是人和机器人各做一遍同一件事。人的这一段操作,要正好对应机器人这一段可以执行的动作。
难就难在这里。
让人和机器人各做一遍,很难保证场景和动作时序逐帧对上。直接照搬人的轨迹也未必成功,因为两边的关节结构和摩擦条件并不一样。
今年 4 月,灵初试过一次正面打法。它让 Psi-R2 和世界模型 Psi-W0 配合。通过轨迹推演和强化学习,把人类操作转换成可执行的机器人数据。
办法能用。代价是多模型协同加策略优化,生产数据的过程比较重。
这次换个方向。
二、从机器人倒着长回人
灵初这次的思路是掉个头。
与其从人类操作出发,再费力生成一段能成功的机器人动作,不如反过来想。真实机器人操作的图像和动作,本来就是现成可用的。
以它们为起点,生成匹配的人类数据,就能得到一份新的对照样本。
按这条思路,灵初逆向使用 Psi-W0。它从真实机器人数据出发,生成对应的人手操作数据。
这批高质量配对数据随后用于训练一个端到端转换器。转换器的输入是人类操作数据,输出是匹配的机器人图像和动作。
这里要分清一件事。转换器不是决定机器人下一步做什么的策略模型,而是一个带动作输出的视频编辑模型。
它要做的也不只是把画面里的人手换成机械手。动作数据要同时给出。
两件事得一起做。
说白了,这是一条很典型的 AI视频 技术路线。画面能被编辑,动作还得能还原。
那转换到底有没有用,要看怎么验。
灵初设了两种验证。一种是直接在机器人上回放转换后的轨迹,看能不能完成同一个任务。另一种是把转换后的数据拿去后训练,再看训练出来的模型能不能干这个活。
判断标准因此换了。不再只是生成的视频像不像,而是这批数据能不能支撑实际操作。
据灵初介绍,转换后的数据在上面的两类测试里已经得到验证。不过部分特别复杂的任务仍未直接完成。
数据转换到位,不等于所有任务都已经解决。
三、数据价值不能只按小时算
除了配对,灵初还在数据本身的质量上做了减法。
一是减少同一任务的重复堆积,二是增加任务多样性。再用自动标注管线把任务拆到更细的原子动作,逐个标注,再逐个审核。
道理不难理解。十万小时的堆积听起来很多,落到具体任务上未必够用。
数据的价值不能只按小时算。还得看它覆盖了多少种任务,机器人真正能用上多少。
换个说法,过去 AI工具 拼的是有没有数据,现在开始拼数据的结构。
四、视频也能当提示
如果一段人类操作能转换成机器人更容易用的参考,它或许还有另一个用途。
它不一定只进训练集,也可以成为当前任务的提示。
这意味着不必把所有要求写成一大段指令,而是给机器人一个例子,照着这个来。
灵初在 Psi-R2.5 里进一步探索了这种上下文学习。它叫 In-Context Learning,简称 ICL。
在它展示的任务里,机器人不需要更新模型参数。线索就在当前上下文里。机器人据此推断该做什么,该怎么做。
这里有个关键变化。新示范不一定要再走一遍训练流程才能影响机器人的行为。它也可以作为当前任务的参考,交给已经训练好的模型使用。
难点还是那个老问题。示范来自人,执行者却是机器人。
灵初的办法还是利用前面的强配对数据模型。它把人类示范转换成对应的机器人数据,再作为提示输入模型。
同一种数据转换能力,由此有了两个用途。一是准备训练材料,二是帮机器人理解眼前的示范。
这也接上了 Psi-R2.5 的双层架构。上层模型负责拆解长程任务,把一段较长的指令分成子任务。下层模型结合子任务和当前观测,输出具体的操作轨迹。
一个负责拆清楚要做什么,一个负责落实到动作。
当然,不用重新训练不等于此前没训练过。它也不等于随手拍一段视频,就能让机器人完成任何工作。目前展示的还是特定任务里的 ICL 能力,更多实现细节尚待公布。
过去几年,大众熟悉的 AI对话 产品处理的是文字。机器人要处理的却是动作。
方向倒是值得继续看。人的示范不一定只能当离线的训练材料,也可能变成使用机器人时的一种交互方式。
五、后训练还是省不掉
预训练已经用掉十万小时级的数据。到了客户现场,机器人却还得接着练。
灵初在最新的技术博客里给了答案。预训练并不是让后训练立刻消失。
这句话很关键。
从部署角度看,眼下训练基础模型的意义很直接。后训练需要的数据会变少,适配与部署的成本跟着降。
手机盒装配就是一个具体例子。这个任务涉及多个步骤,对操作精细度的要求也高。
据灵初介绍,后训练框架结合了人工参与与强化学习。经过几轮迭代,这个任务的成功率到了约 99%。耗时 1 到 2 个工作日。
预训练积累的本事在这里派上用场。机器人不用从零学起,只要补少量任务数据,再把容易出错的地方练好。
到了客户现场,训练也没有结束。机器人在哪里失败,相关数据就被收回来,用于下一轮改进。团队表示,这套方案已经用在真实客户现场。
示范引导和后训练并不矛盾。一个提供表达新任务的方式,一个继续处理具体操作里的难点。
两者都不是让机器人每次从零开始,而是在已有能力上,少花一点适应新需求的力气。
回过头看,具身智能这两年比的是数据量。谁的示范时长更长,谁的动作库更大。
现在比的东西变了。数据能不能对齐,标注能不能拆到动作级,示范能不能直接当提示用。
这几件事都不性感。它们却决定了机器人走出实验室之后,还能不能干活。
灵初这次把问题摆到了数据这一层。方向对不对,还要看后面的实测。
