提起具身智能,画面通常是这样的。
一只机械臂在桌面上抓杯子。一辆小车在走廊里找路。还有一个模型,专门预测行人往哪走。
它们各自干得都不错。
问题在另一头。
这三件事背后,往往站着三套模型。参数不共用,数据不互通,评测协议也各说各话。做机械臂的不关心导航。做导航的用不上人手轨迹。
于是能力攒不起来。
每套模型都从零开始学。数据接不上别人的积累。模型也长不出更大的规模。整个领域被切成一小块一小块。
拆开来是四支队伍。做操作的盯桌面抓取和灵巧控制。导航那支围绕室内路点转。再有一支关心车辆和行人往哪走。剩下的人手动作,输出手腕和骨骼序列。
四支队伍互不通气。结果是三件事同时发生。能力没法跨任务搬。数据没法跨形态复用。整个方向也没法像语言模型那样,把规模堆上去。
有研究团队盯上了这件事。他们问的问题很朴素。这些任务,真的不一样吗。
先看输出。抓取,行走,轨迹预测,人手动作,格式五花八门。
可拆开看,计算结构是同一套。
都是把眼前看到的画面,听到的指令,还有自身是什么机器,一起塞进一个多模态表示里。然后吐出一串未来能执行的信号。
把这句话拆细,共同要素能列得很清楚。
眼前的画面,单帧也行,一段视频也行。指令是一句话,比如把红色杯子放到左边。本体描述写明平台和臂型,还有控制约定与频率。任务标识区分操作,导航,轨迹预测,还是人手动作。
研究团队把这些条件写成同一个预测式。给定画面,指令,本体描述和任务标识,预测未来若干步的动作或轨迹。
过去也有人想统一,卡住的地方一直在动作。各家机器人的动作定义完全不同,谁都不服谁。行业里为这件事争了很多年,标准始终没落地。
最关键的判断,是只统一接口
这篇论文换了个角度。它没有先去统一标准,而是先回答一个问题。这四类任务,输出格式不一样,可计算结构是不是同一套。
那就是强行把各家的动作,统一成同一种物理量。
不同数据的原生控制量差得很远。单臂机器人输出末端位移加夹爪开合。有的平台用绝对关节角。导航输出相对位移加偏航角。人手动作是手腕的位姿变换,再加一组手部系数。
硬把它们投到同一个坐标系,会丢三样东西。
执行器的动力学信息没了。人为折损塞了进来。跨形态的迁移反而更差。
更麻烦的是,这种统一看着整齐,实际是拿形式盖住了硬件和动力学的差别。表面上大家都在同一个空间里,实际上谁也迁移不到谁身上。
那研究团队怎么绕开的。
他们只统一接口,不碰物理量。
所有样本共用一个固定形状的张量。有效通道排在前面,剩下的位置填零。哪些位置真的有效,由一张掩码表说了算。损失只算掩码范围内的部分。
每个数据集保留自己原来的控制约定。
一份数据的动作,该是末端位移就还是末端位移。该是关节角就还是关节角。模型不替它改写法,只负责读懂。
好处在哪。
共享的是视觉理解,空间推理和生成主干。硬件的差异和动力学的差异,一个都没被抹掉。
这条线划在哪里,直接决定了跨形态迁移能做多好。统一的是接口和主干。没被统一的,是各家自己的物理量。
另一头也有代价。各家的控制约定保留下来,意味着模型必须自己去分辨这些差异。这批差异最后落进提示里,由模型在推理时认出来。
这篇论文没把话说满。
联合训练会带来一串新麻烦。操作,导航,看图答题,三种目标的权重怎么配。操作数据占了七成多,会不会把导航的信号淹掉。动作训练会不会让语言模型的推理能力退化。共用的生成模块,会不会被高频的操作任务霸占。
数据比例这一项尤其扎眼。操作占七成四,导航只有七点五。两种信号的量级差了一个数量级,模型很容易只顾着把操作学好。
作者自己也承认,动作导向的训练,可能让一部分纯语言和多模态评测出现轻微回退。
所以结论只到这一步。联合预训练能在共享接口上拿到一个泛化很强的基线。至于专家模型在特定硬件上的优势,它没有说要取代。
大脑管想,手管做

模型是两半拼起来的。
上半是理解。一个四十亿参数的原生多模态骨干,负责看,负责读指令,负责空间推理。
下半是执行。一个十亿出头参数的扩散变换器,专门生成连续动作。
视觉那部分融合得早。图像切成小块以后,直接和文本的词元交织在一起,不是接在末尾。注意力也做了混搭。大部分层用省算力的线性注意力,隔一段插一层全局注意力补推理。
执行那一半不是简单的输出头。它是一块独立的生成模块。十六个扩散块加上投影和时间步嵌入,再算上调制层,凑成十亿多一点。
工作机制可以这么理解。把理解层吐出的隐状态,和一段带噪的动作拼在一起。用联合注意力,让语言和视觉的条件去影响动作。最后由调制层注入时间步信息。再回到连续的动作流场里,反解出可执行的片段。
一句话就是,理解层负责做什么,对谁做,在哪做。执行层负责手怎么动。
输入是三路条件。画面那路最灵活,单帧也行,多帧也行,一段历史窗口也行。研究团队还显式插入了视角标签,让模型分得清第一视角和左右手腕的视角。
指令那路只是一句话,可以带多步,组合和空间关系。这一路和常见的 AI对话 输入没有本质区别。
第三路是本体提示,后面单独讲。
输出是一个固定形状的张量。行数是预测的时域。操作任务取十六步,导航取八步。列数是全部形态共用的通道预算。前面若干列放真实动作,后面补零。
损失只对有效的时间和通道算误差,再对有效通道取平均。省得零填充和通道数多的形态把梯度带偏。
统一表征由四部分组成。固定的预测长度,固定的通道数,前实后零的通道布局,还有一张逐样本的有效性掩码。
四类任务就这么进了同一个框架。
操作输出末端位移和关节,还有夹爪。导航输出地面上的路点。轨迹预测输出未来的坐标。人手动作输出手腕位姿,加十个手部主成分系数。
它们共享的是条件生成加时间块加连续监督。物理量一个都没共享。
量纲处理也很克制。按各数据集自己的分位数做线性映射,裁到正负一之间。消掉的是量纲和幅度。动作的物理含义一点没动。
换平台要不要换模型。不用。研究团队把平台差异写成了一段自然语言。机器人的型号,臂型,控制频率,要预测多长,全都放进提示里。
训练时它就是一段普通文本,过一遍理解层,隐状态再进执行层。推理时只换文本,同一套参数就能切到另一种平台。
覆盖的平台相当杂。单臂有 WidowX 和 Franka。双臂有 Mobile ALOHA。人形有傅利叶 GR-1 和 AIRBOT。移动操作有智元 A2-D 和 Galaxea R1。动作类型也很全,相对和绝对的末端位姿,绝对关节位姿,夹爪,灵巧手都在。
老做法是每套机器人配一个输出头,或者配一个子网。这里的做法是同一套参数加一段文本。把架构上的分支,换成了提示里的路由。
有一个消融挺有意思。本体感受的状态到底有多重要。
在 RoboTwin 那套基准上试了三种喂法。完全不喂状态是一种。把关节角离散成文字写进提示是一种。把连续的关节向量直接灌给执行层是一种。三种做法最大差了不到一个半点。
这说明多视角画面加相对动作,足够撑起当前多数基准任务。可它不能说明状态反馈没用。遇到遮挡,遇到高动态接触,遇到精细力控和关节漂移,状态仍然是关键。
训练混合里,操作轨迹占七成多,是绝对主力。人手第一视角轨迹占六个百分点,提供开放世界的手部先验。导航占七点五,包含每秒两帧的视频,指令和路点。自研仿真轨迹占三点七。通用视觉语言数据占三点四,用来保住感知和推理。剩下的空间定位和自动驾驶问答各占二点五和二点四。
规模上,公开加自研的操作数据超过一万小时。自研真机超过一千小时,约占两成。自研仿真超过八百万条轨迹。
仿真数据走了两条链。一条有渲染也有物理,二十个场景乘十个物体位姿乘四百五十个任务,每个任务三百条轨迹,产出将近三十六万条。另一条只有运动学,六类动作模板配六种单臂构型,每类大约二十万条,合计七百二十万条。它的用途是低成本把语言和动作的对应关系灌进去。
消融给出的最优点挺意外。两成合成加八成真实的语言动作数据,比纯合成和纯真实都好。
训练拆成四步

第一步只训执行层。
这一步冻结理解层,只喂文本和本体提示,连图都不给。目标是让执行层先学会语言和平台的对应关系。一句话加一段提示,其实已经编码了任务意图。而对应的动作,可能是几百个高维关节值。
研究团队把它比作一个有条件的动作解压器。
第二步解冻全部,把语言和动作的先验接到视觉上。
第三步是多任务监督微调。损失权重上,语言那路只有零点一,动作那路是一点零。
第四步才是强化学习。只在 SimplerEnv 这一个仿真环境里做。奖励是稀疏的成功与否,用的是常见的策略梯度方法,目标是抬闭环成功率。
第一步的消融数字最能说明问题。不做这一步,成功率是六成。加上以后到了七成一,整整提了十个百分点。
更有意思的是两个反例。把图像加进第一步,成功率反而掉到五成七。训练步数从两千加到四万,也掉到六成。前者说明,不给视觉条件,执行层才被迫去学语言到动作的映射。后者说明,先验阶段也要早停。
成绩单摊开看
先说评测逻辑。这套工作不只看域内任务成不成,更看场景布局,背景,光照,物体配置和机器人本体变化时还稳不稳。

先看操作。
桌面操作那套基准,从九成出头抬到九成八。一套家庭场景基准,从四成抬到五成七。双臂机器人那两套更难,从六成多直接上到八成六和八成七,涨幅在两成上下。
规律是,双机任务的增益最大。维度高,自由度多,时域长,联合训练的好处就越明显。
和各家专用模型比,桌面那套差一点,九成八对九成九。剩下几套都超了。论文自己也标了清单,说这不算完全公平的横评。有几家的数据没报,本体可能不同,后训练配置也不一致。
再看导航和真实机器人。
视觉语言导航那套,成功率六成对基线的五成七。另一个数据集是六成对五成三。团队的说法是,联合训练没有损害导航。
真实双臂机器人上,从零开始训,域外平均成功率三成六。用预训练基座微调,到了七成七。架构完全一样,只换了初始化和预训练数据。这是预训练本身带来增益的有力证据。
拆到具体任务,抓取放置提升最大,从三成到九成六。毛巾折叠这种可变形物体,提升最小。颜色,实例,背景,指令这几类扰动的提升都在四成以上。位置扰动只有两成不到。
位置的泛化最难。视觉上的鲁棒,不一定能换成几何和位姿上的泛化。
最后是动态操作。只用当前帧,也没做动态微调,零样本成功率达到两成七,超过了一些专门做过动态微调的基线。论文也提醒,绝对数字说明窄义的空间关系泛化还不成熟。
谁在贡献这些提升。分阶段看,监督微调是主要来源,几乎每一项都有大幅提升。强化学习只在它训练过的那一个环境里加了三个百分点左右。其他基准上只加了不到一个点。
结论就是,强化学习的作用不是扩泛化,而是在奖励稀疏时把闭环执行磨顺。
论文列了四条硬限制。
具身动作数据还是太少。长尾的对象,长尾的环境,长尾的形态,还有接触丰富的任务,都不够。多目标联合训练会带来折中,需要手动调权重。评测偏短时程和基准化,长时程,失败恢复和真实部署都没覆盖。各行各业的指标也不能直接相加,硬合成一个综合分只会把语义搅浑。
团队给的能力边界也很克制。已经证明的是宽域感知加中短程动作生成。没证明的是物理因果和安全闭环。柔性物体,遮挡,双臂接触动力学,力触觉反馈,这些都不在里面。
论文自己也强调,那些具体数值都是特定数据集和实验栈下的最优值。
七成多的操作数据比例,不要照搬。两成的合成数据比例,不要照搬。两千步的先验训练,也不要照搬。换一套硬件和噪声,这些超参都要重新验证。
值得迁移的是流程的结构。
先定义统一接口。张量形状,有效掩码和平台元数据一起定好。再建语言和动作的配对,让执行层在没有视觉的条件下先形成先验。这一步可以用不渲染的合成轨迹低成本扩量。然后解冻视觉主干,做联合接地。接着上多任务监督微调,语言那路的权重压得比动作低。最后在奖励能可靠测量的环境里再加强化学习,同时盯着别的领域有没有遗忘。
这套流程对做 AI工具 的团队也有参考价值。凡是多来源数据要拼在一起,接口设计和掩码机制往往比模型结构更关键。
诊断框架同样可以照搬。先看动作先验的基线,再看视觉接地带来多少增益。然后是下游任务,最后是闭环执行。哪一段掉链子,就知道问题出在先验,接地,模仿还是奖励设计。这一套跟 AI编程 里的分层排查是一个思路。
研究团队还点出三条最该补的证据。公平对比要在机器人,频率,图像输入,样本和评测协议完全对齐的条件下做。真实长时程评测要报成功率,恢复率,碰撞率和执行时间。数据贡献要做归因,别把所有增益一句带过地算在大模型头上。
一句话总结这套工作的位置。它给通才具身模型提供了一个可验证,可扩展的强基线。跨机器人,跨任务和跨环境的通用控制,还没有解决。
