成立三个月的团队,首款物理模型拿了榜首

一家成立三个月的公司,交出了自己的首款物理模型。

它叫 Simate-beta。

据这家公司披露,它在 RoboDojo 排行榜上排到了第一。

平均得分 33.95。

成功率 27.96%。

榜单成绩不等于模型的全部能力。

但它能看出一支队伍的研发速度。

按团队的说法,这次参评的基础模型没有针对榜单做过任何专门优化。

Simate-beta 在 RoboDojo 榜单的得分与各维度表现

Simate-beta 在 RoboDojo 榜单的平均得分与各维度表现

公司名叫 Simate,可以理解成「硅基伙伴」。

来头不算小。

核心团队此前做的是端到端智驾,一路把能力推到对标特斯拉的水平,并且完成了量产落地。

全球跨过这道门槛的团队本来就少。

带着这套积累转头去啃通用物理智能的,更少。

三个月,首版模型就交出这样的成绩。

更新于 2026 年 9 月 23 日的 RoboDojo 榜单

更新于 2026 年 9 月 23 日的 RoboDojo 榜单

比成绩更值得看的,是他们从创立第一天就定下的做法。

让 AI 参与物理智能本身的研究和迭代。

公司按这条路线去组织模型和数据,也把算力与实验流程一并拉进来。

Simate-beta 是这套体系的第一个产物。

研究工具也已经有外部人在用。

参与自动研究平台内测的研究者,来自麻省理工和加州理工等高校,也有清华和北大的。

配套的基础设施覆盖训练和仿真,也包括推理。

同期,这家公司连续完成多轮融资,每轮都是亿元人民币级别。

一、第一天就定下的做法

公司把这条路线叫 AI for Physical AI。

翻成大白话,就是让机器参与物理智能的研究与迭代。

三个月里,模型和研究平台在推,外部试用和融资也在推。

这个速度确实让人想看看下一步。

团队给了预告,已经形成面向复杂任务零样本泛化的技术思路,阶段性成果计划在今年年底推出。

在他们看来,机器参与物理世界的操作,是预料之中的进展。

物理智能的突破,可能比外界想的来得更快。

他们想打破的是逐任务适配和后训练的依赖,推动这一行迎来自己的「GPT-3 时刻」。

模型和自动化研究等三项工作,会通过论文和技术报告陆续公布。

成果计划分阶段开源。

这份速度能不能持续,是接下来最值得看的事。

二、一个只管毫秒级反应的快系统

Simate 最终想逼近的,是零样本和少样本下的通用物理操作。

意思是,在一个全新的陌生环境里,系统不该每加一项新任务,就重新采一批数据,训一次模型,再调一遍工程。

这正是当下物理智能最热也最难的一条赛道。

它给出的现阶段解法,叫通用物理快系统。

也就是「系统一」。

先打个比方。

面对「帮我把桌子收拾一下」这类指令,我们需要「系统二」去理解意图,拆分步骤。

可当手已经伸向杯子,接下来往左偏几毫米还是往右挪一点,这种毫秒级的反应,不可能每一步都靠深度思考。

物理智能也是这个道理。

一个通用的「慢系统」管高层规划和复杂推理。

一个足够强的「快系统」负责实时感知眼前不断变化的物理世界,并极速输出动作。

Simate 选的是后者。

把快系统的参数量做大,去探索零样本泛化能力的涌现,同时挑战端侧可部署模型的上限。

大和快,本来就是一对难做的取舍。

他们从两件事入手。

第一件是 4D 物理感知。

要理解物理世界,必须同时抓住空间结构和时间维度的变化,让物理表征真正服务于行动。

第二件是分层时序记忆。

长程任务要记住此前发生的事,连续操作要追踪状态,即时反应又不能被庞大的历史信息拖慢。

时序记忆与分层结构示意

分层时序记忆,是快系统的两个着力点之一

这两件事共同指向一个目标,和人类快系统处理连续世界的方式对齐。

这条路线也延续了团队的两段积累。

一段是大规模视觉模型和时序建模,另一段是实时推理和量产部署。

具体的架构和模型规模,会在后续技术报告里披露。

他们想达到的状态是,模型既清楚眼前正在发生什么,也记得刚才发生过什么,还能及时决定下一步。

再和前沿模型代表的通用推理能力协同,往复杂任务的零样本执行推进。

从公司给出的真机展示看,测试围绕四种场景展开。

演示驱动的任务适应。记忆。复杂长程执行。精细操作。

这个成绩只代表榜单评测表现,真机表现另行展示。

这份模型答卷背后,还有另一套同样值得展开的系统。

长程规划与任务适应示意

长程规划与任务适应,也在真机展示的清单里

三、让飞轮转起来

这几年,大家已经习惯 AI编程。

可在 AI 研究里,写代码只是一小部分。

能替人写代码的 AI工具 不少,能替人排实验的不多。

很多时候,迭代效率才是决胜的地方。

谁能在单位时间里验证完更多假设,谁就先跑出来。

举个最简单的例子。

机器人的长程任务总卡在某个环节,原因无非几种。

数据分布失真。模型结构有瓶颈。轨迹比例失衡。训练策略失效。

每一个方向背后,都对应十几组甚至几十组实验。

如果全靠研究员手动改配置,手动开任务,手动盯训练再跑评测,最后把结果整理回来,那就太慢了。

所以 Simate 做了自动研究引擎,用来加速这一流程。

人类研究员提出假设,设定目标,划定约束。

引擎自动接棒。实验怎么拆,流程怎么跑,结果怎么回,全都交给它。

跨仿真环境与世界模型的评测流程

自动研究引擎接手了实验的拆解与执行,也包了反馈环节

结果也出来了,他们靠这套方法在榜单上拿下第一。

更关键的是速度。

从成立到登顶,前后只用了三个月。

就离谱。

榜单公布后的社交平台截图

榜单出来之后,团队内部的反应

所以问题就来了。

机器到底该怎么研究机器。

显然,只丢一个智能体进去远远不够。

真正的机器人研发,底层穿过了模型代码和数据管线。训练集群和评测环境也在里面。真机反馈也在。还有过去数月甚至数年的实验记录。

本质上,这依然是「上下文」的问题。

智能体需要一个能调度一切的超级接口。

为此,他们搭了一套三层结构。

上层是模型框架,中间是自动研究引擎,底层是原生基础设施。

开源出来的研究基础设施页面

三层结构:模型框架层、引擎层与基础设施层

第一层要解决的是,让模型对机器可读。

把机器人模型搭建成机器能轻松读懂的结构。

模块边界。系统接口。配置项。验证流程。每一项都定义得尽可能清楚。

只有这样,智能体拿到课题之后,才能精确知道该改哪个模块,改动会波及什么,最后又该怎么验证。

目前这套基础设施已经搭完,接入了世界模型和世界动作模型,也接入了视觉语言动作模型和视觉语言模型。

不管是人类研究员还是智能体,都能自由组合组件、调整局部实现,并沿用同一套训练和评测流水线。

第二层要解决的是动态信息差。

研究推进到哪了。以前踩过什么坑。最新的证据又是什么。

它把外部论文和内部研讨材料汇进来,也把模型代码、数据配比和实验日志一并汇入同一份动态上下文。

不管是发了新论文,内部代码提交了新版本,还是最新数据推翻了旧假设,这份上下文都会实时刷新。

这样,智能体给出的每一条研究建议,才能锚定到具体的代码分支和实验版本。

最有趣的地方是人类经验和机器实验的耦合。

研究员可以随时注入约束、调整方向。

一旦某次实验验证了有效组件,它会立刻变成后续实验的新起点。

某个分支总结出的方法论,也能被下一个智能体无缝复用。

研究成果,就这样变成了下一轮研究的生产资料。

第三层要解决的是算力怎么不浪费。

训练和推理的过程,连同评测环节,都接进了自研基础设施。

通过极致的任务编排和资源调度,同时并行推进数十条相互独立的研究路线。

为了不浪费算力,他们设了一道高频筛选。

所有路线先经「世界模型加仿真环境」做第一轮快速过滤,淘汰掉绝大多数无效方向。

只有真正有潜力的方案,才会进入真机实测。

真机上冒出新问题,再重新流回那份研究上下文。

闭环就这样形成了。

最后的画面是,人只抛出一个探索方向,底层系统就能自动并发驱动数十轮实验。

这也是他们能在三个月里登顶的原因。

最让人意外的是,这样一套核心的内部生产力工具,他们选择直接开源。

网页长这样,感兴趣的朋友可以文末自取。

研究基础设施的介绍页

开源出来的研究基础设施页面

目前进驻内测的研究者,来自清华、麻省理工和港科大。

四、起点是弱自我改进

创始人叫张颖,曾是某一线智驾公司的核心技术负责人。

工程实战经验很足。

他参与过三代智驾方案的攻坚,也做过很多年量产。

据介绍,他推动打造的智驾系统,是国内最接近特斯拉的那一套。

团队里还有两位关键人物。

一位是占方能。

香港科技大学的助理教授,世界心智实验室负责人,长期研究世界模型和物理智能。

另一位是季马泽宇。

00 后青年科学家,方向横跨 3D 感知、灵巧操作和人形机器人的全身控制。

加入之前,他是硅谷一家机器人智能公司的创始成员。

那家公司后来被 Meta 收购。

资本市场也已经用真金白银投了票。

成立三个月,连续完成多轮融资,每轮都是亿元人民币级别。

这一切都在押注同一件事。

物理层面的递归自我改进。

自我改进形态的划分示意

三种自我改进形态的划分

这家公司从创立第一天就瞄准了这个方向,还定义了三种不同类型的自我改进。

第一种边界明确。

人机共驾的模式下,研究员设定目标和约束,正常执行过程中不再需要人一步步参与,异常可以升级处理。

这次登顶榜单,就是第一阶段的工程验证。

第二种方向明确,但答案未知。

怎么改善模型记忆。某类任务的数据比例到底怎么配。

方向已经有了,具体哪个方案有效还得靠多轮实验去找。

这时候,智能体负责整理上下文和实现方案,也负责跑实验和比较结果。

研究员则负责筛假设,解释冲突证据,以及做关键取舍。

这一类也是现阶段最有现实价值的。

第三种最难,因为它要求研究本身被自己发现。

怎么提升模型在全新任务里的泛化能力。

这类问题已经没有清晰的解题路径。

系统得自己理解目标,发现真正值得研究的问题,还要在很长时间里保持方向感,不断修正路线。

这就开始涉及所谓的「研究品味」。

现阶段,这类工作依然需要资深研究者主导。

智能体更多是在文献和证据上、以及在实验和路线探索上提供支持。

值得注意的是,弱中强三种形态并没有等级之分。三者可以同时存在于同一套研发系统里。

再说一件小事。

系统的每一次自我改进,都在让下一次改进更容易发生。

当数据、模型与真实部署连成一个会自己转起来的闭环,机器人的上限才不再只取决于人的上限。

这就是物理层面的递归自我改进,目前冲线物理通用智能最热门的候选路线。

当然,这家公司现在展示的还只是早期形态。

人在回路里依然存在,研究员仍然掌握着整个循环里最关键的方向判断。

可这也说明,自动化研究不一定非要等到完全没有人类参与那一天,才开始产生价值。

在更强的自主研究能力真正出现之前,先把实验设计和训练环节交给机器。评测和反馈环节也一样。这一步本身就能提升研究吞吐。

榜单上的这份成绩,也算是验证了「人机共驾」这条路径在物理智能领域的可行性。

自我改进,真的开始了。

文章收尾时的表情包

写到这里,大概就是这个表情