GPT-6 Astra 接管机械臂:抓积木 20 次成 19 次,拼图只成 2 次

一台售价 150 美元的桌面机械臂,画出了一座金门大桥。指挥它的不是人,是 GPT-6 Astra。

没有预设轨迹。它先自己判断从哪儿落笔,再靠摄像头边画边看,最后画出红蓝相间的桥身。

机械臂在模型控制下画出的金门大桥

这段视频传开之后,Sam Altman 转发了它。

最近几年,机器人圈一直在追问同一个问题。谁会成为机器人领域的 OpenAI。

现在看起来,答案可能就是 OpenAI 自己。

通用模型接上机械臂,不用专门训练

画桥只是开场。

CMU 机器人实验室的 Wenli Xiao 做了一个更硬的实验。他先录下一段人类完成新任务的视频,把录像丢进 Codex。然后让 Astra 控制机械臂照做一遍。

第一次就成功了。

照着人类演示视频完成任务的机械臂

他把这个现象叫作 physical ICL。过去大模型能从上下文里的文字和代码示例中临时学会一件事。现在,这套本事搬到了物理世界。

AI编程 里常见的做法一样。先给一份示例,再让它照着做。

另一批人干脆让它去当机器人工程师。有人把真机演示的多视角画面和动作数据喂进去,让它自己处理相机标定和场景重建。物理参数也交给它,再把真实环境搬进 MuJoCo。

从真实环境重建出的仿真场景

出来的是一个能继续做接触仿真、还能回放动作的 real2sim 环境。不只是长得像的三维场景。

还有人把机械手换得更复杂。Dmytro Hrybov 在 MuJoCo 里给它配了一台 Kinova Gen3 机械臂。手上再加一只 Shadow Hand 灵巧手。任务挺文艺。握住铅笔,画出毕加索那只著名的鸽子。

笔要真的落到纸上,事情就麻烦了。机械手得同时管住握笔姿态,还有手指与铅笔之间的摩擦。笔尖碰到纸面的那一下,也不能失手。

机械手在仿真中握笔作画

真正说明问题的是下面这组实机测试。RoboCurve 把它接到两只真实的双臂本体上。每一步,它都能看到三个相机视角,外加机械臂自己的状态。

它给出的东西很窄。两只末端执行器该去哪儿,姿态怎么摆,夹爪开还是合。至于关节转多少度,交给底层的逆运动学去算。

任务是把桌上的红色积木抓进旁边的碗里。20 次里成功 19 次,成功率 95%。同一套测试里,Fable 5.1 只成了 8 次。

双臂实机抓取测试的成功率

一个没有专门为机器人训练过的通用模型,做到了这个程度。20 次不算多,别急着拿这组数字给整条赛道下结论。

过去两年,我们谈 AI工具,说的都是屏幕里的活。这一次它伸手碰到了桌面。

过去那条路,是专门造一颗机器人大脑

这个问题恰好撞上了机器人行业最热的一条路线。

前几年,这条赛道冒出了两个明星。一家叫 Physical Intelligence,另一家叫 Skild。前者想训一个能跨任务,也能跨不同机器人本体的通用基础模型。π 系列把视觉、语言和动作塞进同一套网络里。后者的目标写得更直接,任何任务,任何机器人,一个大脑。

思路是一致的。语言有基础模型,机器人也该有。

所以谁会成为机器人领域的 OpenAI,一直是这条赛道绕不开的坎。

等它真的出现,答案有点出乎意料。亚马逊 Alexa 团队的首席科学家 Zeeshan Zia 给了一个判断。机器人领域的 OpenAI,看来就是 OpenAI 自己,而不是那两家专做机器人的公司。

这句话刺耳的地方在于,它没走传统路线。

它没有先攒下海量机器人轨迹,再从头训练一套从视觉到动作的模型。它带来的是另一种可能。如果通用人工智能已经足够强,还需要再造一颗机器人大脑吗。

这个问题放在 OpenAI 身上格外微妙,因为它很早就做过机器人。

2018 年,它推出过 Dactyl,让一只灵巧手在真实世界里转动物体。后来又让同一只手去拧魔方。

早年灵巧手旋转物体的演示

几年后,它把机器人团队关了。当时的负责人 Wojciech Zaremba 讲过一个很现实的理由。机器人缺少像互联网文本那样能大规模拿到的数据。文本和图像可以从网上扒,机器人数据又贵又慢,覆盖不了足够丰富的真实场景。

有意思的是,当年因为数据离开,如今可能从另一条路绕回来。

大脑和身体,各管各的

现在的做法,不是让它直接控制每一台电机。

还是那组双臂测试。它每步拿到三个相机视角和机械臂状态。给出的答案只有目标位姿和夹爪开合。至于关节转多少度,交给底层控制器。

分工很典型。它负责判断手该往哪去。传统控制栈负责解决每个关节怎么动。

英伟达前研究科学家 Yu Xiang 判断,接下来值得盯的方向换了。重点是怎么把最先进的模型真正接进操作任务。相比只待在顶层拆任务、调工具,它已经更直接地介入动作决策。

研究者对模型接入操作任务的判断

再往下走,问题就露出来了。

有人让它直接输出四足机器人的关节目标。频率按 50 Hz 来,像强化学习策略那样控制它走路。实验确实跑起来了。可它的推理速度跟不上实时控制,物理模拟必须在两次调用之间暂停。250 次推理,换回来大约 5 秒钟的行走。

四足机器人行走测试的表现

它能决定下一步该往哪动。让它接管毫秒级的底层控制,眼下还不现实。

更现实的形态是继续分层。它负责理解环境,判断目标,还有规划动作。低层策略和控制器负责把意图快速稳定地变成动作。宁可多留一层控制器,也别让一个模型从头管到脚。

最后几毫米

会规划动作,离把动作做好还有一段距离。

还是那组实机测试。抓积木入碗那一项,成功率 95%。任务换成把圆形拼图对准凹槽嵌进去,成功率掉到 10%。20 次只成了 2 次。

拼图嵌入任务的成功率变化

失败的位置很集中。它找到了拼图,抓住了旋钮,也能把它挪到凹槽边上,就是塞不进去。

差的就那几毫米。位置和角度稍微偏一点,零件就对不上。真的接触之后又会被硬件误差干扰,下一个动作接不上。

这也是为什么有人专门盯着「最后一毫米」。Physical Intelligence 最近的实验就做这个。在他们的测试里,让一个通用模型拿起螺丝刀不难。要又快又准地对准一颗很小的 M3 螺丝,还得靠在线强化学习继续调。网线插入和电源线插入,还有扎带固定,卡点都在同样的位置上。

通用模型在精细接触任务上的表现

它现在最强的地方,集中在头脑该干的活上。理解环境,判断目标,还有规划动作。一旦进入高频反馈、精细接触和力控制,机器人自己的身体经验仍然不可替代。

于是前面那个争论,就留下了一个悬念。

机器人当然可以拿最强的模型当大脑。能配得上这颗大脑的身体,还没有出现。