乐享科技谈机器人「自进化」:经验能写进模型,还能换一具身体接着用

最近,具身智能公司乐享科技抛出一个不小的说法。它说自己研发的以太大模型能在部署和执行过程中持续更新。这种能力被它叫做「自进化」。它还称这是全球首个能自进化的具身智能模型。

这个词很容易引起争论。「进化」指的是模型参数真的变了,还是只是临场调整了一下动作。一次调整要到什么程度,才算能迁移的新能力。一个模型能适配不同场景和不同身体,这属于工程上的泛化,还是更强意义上的持续成长。眼下机器人行业连稳定执行都还没完全解决,谈自进化确实要谨慎。

为了证明这件事,乐享科技做了一场户外直播。按直播前公布的目标,搭载以太大模型的机器人要在户外接随机点单。它得做完食材处理和烤制,再翻面上菜。中间还要应付临时打断。需求临时增加和场景变化,也得接住。

现场有三十多位专业媒体,线上超过五百五十万观众。整个过程并不顺利。

机器人在户外直播现场做自主烧烤演示

机器人完成了部分自主烧烤动作。中间有停顿。有失败。也有重新调整。乐享科技并不回避这些不完美。它想让人看的不是零失误的流程复现。任务和环境变了之后,机器人还能不能继续找信息,还能不能调动作,还能不能把任务往前推。两台机器人本体全程互相传任务信息,自己判断,自己分工。

一场直播回答不了关于自进化的所有问题。但它至少给出了一种态度:机器人可以失败,真正要看的是失败之后发生了什么。

在乐享科技看来,自进化不能只是一个好听的词。它至少要回答三件事。第一,机器人能不能发现现实和自己的预测对不上。第二,它能不能判断哪些经验值得留下,哪些应该忘掉。第三,它能不能把一次任务里的经验,搬到新的任务、新的场景和新的身体上去。

带着这些问题,我们和乐享科技背后的团队聊了聊他们的思路。

第一层变化:不是更会模仿,而是能不能理解真实世界

过去几年,具身智能最常见的做法是把视觉、语言和动作接起来。机器人看到环境,接到任务,再输出动作。这条路线的价值很直接。它让机器人可以借助大规模数据学习人的示范,复杂指令也开始有机会落到具体动作上。

但在乐享科技团队看来,这种从输入到动作的映射有个根本限制。它擅长回答下一步该做什么。它未必真的理解为什么要这么做。更未必知道这个动作会给真实世界带来什么后果。

团队把视觉语言动作模型的局限概括为「不懂因果」,把传统世界模型的问题概括为「可生成、不可执行」。按他们的判断,前者接近从已有数据里学动作规律。这并不自然等于理解动作和结果之间的因果关系。后者能预测世界可能怎么变,却不代表预测出来的未来一定能在机器人的关节和力矩上实现。

具身智能从动作模仿走向理解行动后果

真实世界不是一组干净的输入输出。接触力和摩擦力会变。滑动和遮挡会变。物体形变也会变。目标还可能临时改。这些都会让同一个动作产生不同后果。

一个杯子的质量翻一倍,关节要输出的力矩就得跟着变。液体的重心不停移动,机器人也不能照抄某条既定轨迹。画面上看起来合理。真到了身体上,还不一定做得到。

这解释了乐享科技为什么没有把重点继续放在动作预测上。

按团队在采访里的描述,以太大模型是一套由世界状态、内部状态和能量状态耦合起来的动力系统。感知和预测都还在,行动也还在。但它们不是三个依次调用的独立模块,也不是一个从输入直接吐出动作的黑盒。团队更愿意把这种机制叫做能量驱动的状态转移。

这里的能量不是指电池还剩多少电。相关负责人把它形容成一张贯穿系统的评价地形。哪些状态值得靠近,哪些应该舍弃,当前还缺什么信息,接下来该把算力和注意力放到哪里,都在这张地形上一起衡量。

这样一来,感知本身也变成了任务的一部分。机器人不再被动接收摄像头传回的画面,而是带着问题去找答案。为了继续行动,我还需要看到什么。当前视角能不能消除不确定性。要不要先挪一下身体,换个观察位置,再决定下一步。团队把这种能力叫做带感知意图的主动感知。

这套思路在「太极宗师」这个任务里更直观。机器人左手要控制杯里的液体不洒,右手还要维持另一个物体稳定。液体状态和外部扰动一直在变,关节状态也在变,靠一条固定轨迹很难做完。按团队的解释,系统需要建立动作、物理状态和结果之间的因果关系,再根据后果不断调节控制。

这还不能单独证明机器人有了完整的物理直觉。但它至少说清了乐享科技想解决的问题。真正难的不是生成下一个看着正确的动作。难的是让动作站得住。那个物理世界一直在变,还会反过来影响机器人。

从模仿动作走向理解后果,是这条路线第一层变化。它也给自进化提供了前提。如果机器人识别不出现实和预测的差异,就不知道自己错在哪,更谈不上从错误里长出新的能力。

第二层:自进化不是口号,而是一套闭环

那么,乐享科技凭什么认为以太大模型可以自进化。采访中我们把问题问到了模型内部。机器人执行任务的时候,变的只是瞬时状态和记忆,还是策略乃至模型权重。

乐享科技的回答是,这些层级都会更新。按团队的解释,他们说的自进化首先发生在执行过程中的预测误差修正,但并不止于一次性的状态调整。

机器人行动前先形成预测,执行完再观察结果,然后把真实结果和原来的预测比一比。如果世界已经不是刚才以为的样子,系统就要更新内部状态。它要判断原计划是否失效。之后再做局部或者全局的重新规划。这个过程不是任务失败之后的补救。它伴随每一次行动持续发生。

目标临时改变时,系统会重新判断原计划还适不适用,然后生成新的动作。用团队的话说,系统一直在追问,眼前看到的世界是否还是刚才以为的那个世界。从预测到执行,从反馈到更新,再到再次行动,它始终在循环里。

演示里有个例子。机器人要处理一块有污渍的玻璃。它发现污渍不在自己面对的这侧,而在玻璃外侧,于是换了做法,把手伸到窗外继续擦。

机器人在执行过程中根据反馈重新规划动作

这和传统意义上的动作预测有一个明显区别。后者更关心在当前输入下输出什么动作。按乐享科技的说法,以太大模型会同时维护世界状态、任务状态和系统自身状态。一次行动之后,变的不只是机械臂的位置。短期经验和技能参数也可能变。系统对某种因果规律的判断,同样会变。

长时序任务因此成了一个重要观察点。团队提到,乐享科技展示过一镜到底的连续任务。机器人需要理解步骤之间的先后关系,还要记住自己做到哪了。中途改目标,或者被打断之后接着做,都得能应付。单个动作准不准当然重要。更难的是在持续变化里保持统一理解。当前世界是什么样。任务进行到哪。下一步为什么这么干。

但能根据反馈调整,还不等于能持续学习。在线学习最大的风险,是把偶然扰动当成规律,把错误经验写进模型。更糟的是学会新东西时,把原来的能力弄丢了。

按乐享科技的说法,以太大模型不会让所有新经验直接进长期知识。系统会先评估一次经验是否可靠,是不是够新。能不能归因,能不能泛化,也要看。之后再决定它值不值得改变已有知识。换句话说,学习能力的一半是知道什么该学。另一半是知道什么不该学。

和这套筛选配套的是分层记忆。越具体、越依赖单一场景的状态,生命周期越短,任务结束就可以清掉。越抽象、经过反复验证的规律,保留时间越长,也可能进入世界模型和因果模型。

分层记忆机制下的经验筛选与长期保留

模型会不会真的调参数,是区分临场适应和自进化的关键。团队明确表示,经过筛选和验证的经验也可能进一步影响模型权重,并被长期保留。如果只是某个场景下的临时状态,就不会永久写进模型。也正因为更新可能从记忆和策略继续往参数层走,乐享科技才把这套机制称为自进化。

不过这里要留一个边界。目前我们拿到的是团队对内部机制的解释。权重怎么变,变化幅度多大,新能力能不能稳定留下来,还需要更具体的测试结果来呈现。

数据的角色也因此变了。真人视频用来理解人的行为逻辑,推测意图,构建认知,类似一次预训练。示教视频负责把认知落到可执行的动作上,团队形容这是给机器人上幼儿园。真实运行数据用得最少,却承担最重要的真实环境校准,也就是让机器人在真实环境里接受检验。

团队还有一个更形象的说法。机器人可以给自己做错题本。真正有价值的不是记住某一次失败,而是从失败里分出可以复用的规律,下次遇到相似但不完全相同的任务时再调用它。

这也解释了为什么泛化性是判断自进化成立的关键。如果所谓学习只能留在原来的任务和原来的机器人身上,它更像一次局部调参。只有经验能穿过场景和本体的差异,才可能变成更一般的能力。

据相关负责人介绍,以太大模型已经在约五家不同机器人本体上积累经验。双臂、双足和轮式形态都有涉及。不同本体在关节数量和自由度上不一样。末端执行器不一样。质量分布和控制方式也不一样。传感器布局同样有差异。迁移到新机器人时,团队通常希望先拿到关节名称和传感器配置。后面要做运动学对齐和传感器标定。再往后是动力学参数辨识和进一步微调。

以太大模型能做到一脑多形。关键在于接入一个全新本体之后,它能自己摸索。这个本体的性能差异、关节限位等约束,都会被它认出来。再据此生成适配的动作和轨迹,任务就完成了。由此,模型完成了对本体的自我认知和适配,软硬件也就解耦了。

以太大模型在不同机器人本体上的迁移适配

控制系统同样体现了这种分工。团队说的两百赫兹以上,覆盖的是状态读取、控制器计算和关节指令更新。高层感知和推理并不按同一个固定频率跑,而是根据任务复杂度和当前不确定性调整周期。高层推理需要更长时间的时候,主动感知反而可能更频繁,好拿到更多信息。

所以乐享科技说的自进化,不是机器人突然有了自我意识,也不是一个简单的端到端黑盒。它更像一组综合的工程机制。主动获取信息。根据预测误差调整行动。筛选值得学的经验。把不同层级的经验存进不同的记忆。再试着把比较稳定的规律迁移到新任务和新身体上。

第三层:衡量机器人的方式要变了

过去的机器人更像被训练好的执行机器。规定动作可以做得越来越准,任务之外的经验却很难沉淀。它可以被部署到现场,现场的反馈未必会变成长期能力。它也可以换场景、换身体,但每一次迁移常常近似重新开始。

乐享科技借以太大模型想说的,是让部署本身成为学习过程。机器人进入真实世界之后,不再只是消耗训练阶段拿到的东西。它也可能在一次次行动里校准对世界的理解。那些可验证的经验,会慢慢变成新的能力。

它和只会一问一答的 AI对话 产品不是一回事。机器人要做的判断,最后得落到关节和力矩上。

最近围绕下一代模型的讨论,也让很多人重新想跃迁会从哪里来。人们关心的已经不只是参数是不是更大。推理是不是更强也在被追问。他们更想知道,模型能不能在更长周期里积累经验,能不能形成记忆,能不能在持续交互里改变自己的能力边界。落到机器人身上,这个问题会更具体,也更严格。每一个判断最后都要接受物理世界的检验。

如果具身智能只是从指令走向动作,它仍然是一种更复杂的自动化。如果机器人能在行动里发现偏差,在反馈里筛经验,在记忆里沉淀规律。再把这些规律带到新的任务和身体上,那它就不只是更会干活。它开始有了一点生长性。

当然,关于自进化,乐享科技要回答的还有很多。泛化能跨越多大的任务差异。学习能持续多久。模型的变化怎么被量化。新能力能不能在不同机器人上稳定复现。长期运行之后,怎么证明旧能力没有退化。

但眼下展示出来的东西,已经把问题往前推了一步。衡量机器人的方式,或许不再只有它会做什么,还要加一句。它做完之后学会了什么。

一旦机器人真能把现实世界里的经历攒成能力。这些能力能积累,能验证,也能迁移。它改变的就远不只是一次演示,也不只是一家公司或者某条技术路线。那意味着机器人不再只是被制造和被训练的机器。它被部署到现场之后,可能成为一种能在世界里持续获得经验的行动系统。

这类 AI工具 的价值,从来不在参数表上。它把想和做之间那段反复切换的过程,交给了同一套机制。人只要把需求说清楚。说清楚就够了。