大语言模型的红利期过了半程。
物理世界成了下一个方向。
仅今年一季度,全球物理智能领域的融资就超过 64 亿美元。
钱大多流向世界模型和基础模型。

让机器先在脑子里预演一遍世界。
再到现实里动手。
这条路被看成通向机器人、自动驾驶的必经之路。
最早也最响亮的布道者是李飞飞。
她那句“宇宙并非由文字构成,而是由真实的事物构成”,几乎成了整条赛道的开场白。
这条路才刚起步。
李飞飞不等了。
交易约 82 亿美元。
全部用股票支付。
完成后她出任这家芯片厂商的执行副总裁兼首席科学家。
直接向苏姿丰汇报。
被买的那家公司成立才两年多。
今年 2 月刚融完 10 亿美元。
投后估值约 54 亿美元。
七个月后,出价高了五成多。
这是它史上第二大收购。
仅次于 2022 年那笔 500 亿美元的买卖。
两者却不太一样。
被买的对象没有成熟产品线。
也没公开过收入数字。
第一款商业产品去年 11 月才上线。
新一代模型更晚。
交易宣布前不到一个月才亮相。
同一个月份,另一家芯片巨头也动了手。
它以约 129 亿美元,签下开源模型社区。
两家芯片厂先后把手伸向模型层。
2012 年有场图像识别比赛。
一个神经网络大幅领先。
它用的正是那家巨头的显卡。
那场比赛被看作深度学习时代的起点。
也间接成就了对方十几年的江湖地位。
而那个比赛数据集的创造者,就是李飞飞。
十几年后,她选了另一家。
消息在美股收盘后传出。
盘后股价只涨了 0.4%。
随后三个交易日,累计涨幅不到 2%。
一家明星公司。
一笔创纪录的收购。
市场的反应却很平静。
世界模型这条赛道,眼下还撑不起一个确定的估值。
世界模型,到底在造什么
估值撑不起来,原因就藏在名字里。
大语言模型擅长语言。
它能把物理讲得头头是道。
却未必真懂我们所在的物理世界。
世界模型走的是另一条路。
先在心里预演一遍世界。
再决定怎么动手。
这跟游戏引擎不一样。
后者是工程师一行行写死的规则。
前者是从海量视频和数据里学出来的规律。
规则精确,可验证。
可能写不完现实世界的复杂。
学出来的规律能泛化到没见过的场景。
代价是不够精确,偶尔会编。
天气预报是个现成的例子。
传统做法是把大气切成网格。
一格一格解流体力学方程。
这几年,这类模型不再解方程。
它直接从几十年的气象数据里学天气怎么变。
有些指标上已经追平传统方法。
速度还快得多。
气象模型,本质上就是一个只管天气的世界模型。
世界模型公司想做的,是把这件事放大到整个物理世界。
李飞飞今年 6 月写过一篇文章。
她承认一件事。
计算机视觉说自己在做世界模型。
机器人也说自己是在做。
强化学习和生成式模型同样这么说。
说的却不是同一件事。
她把这门生意分成三层。
第一层是渲染器。
按条件生成逼真的画面或三维场景。
它离 AI视频 和三维生成并不远。
市面上不少 AI绘画 产品,做的也是同一件事。
第二层是模拟器。
给一个动作,预测世界会怎么变。
比如机械手往左移 5 厘米,杯子会不会倒。
第三层是规划器。
用内部的理解直接决定下一步怎么走。
这才是世界模型最早的学术含义。
落到具体玩家身上,层次就清楚了。
有国内厂商做出了能走进去、能导出的三维世界。
海外那家同类产品也停在第一层。
有搜索巨头和国内另一家,把画面做成随操作实时变化。
它们卡在第一层和第二层之间。
以色列有家公司两头下注。
一个产品改写视频画面,偏渲染。
另一个面向机器人和自动驾驶,偏模拟。
芯片巨头那套是一整条产品线。
从画面生成到物理推演都有覆盖。
重心压在机器人和自动驾驶上。
自动驾驶公司的驾驶模型,是第二层最典型的代表。
还有人干脆跳过画面。
只在抽象空间里学世界怎么运转。
不过眼下大多数商业化的世界模型,做的还是第一层。
有团队把它拆成三步。
理解当前状态。
预测下一状态。
最后渲染呈现。
多数模型跳过了前两步。
直接去做渲染。
有厂商负责人早在 7 月就放话。
2026 年是世界模型元年。
另一家初创的负责人也对媒体说过类似的话。
六个月之内,每家公司都会自称世界模型公司去融资。
市场常常用第三层的愿景,给第一层的产品定价。
用法已经有了,还都很朴素
说它停留在幻灯片阶段,并不公平。
它已经有真实用户。
只是用法比宣传朴素得多。
今年 2 月,一家自动驾驶公司发布了改造过的世界模型。
它能模拟龙卷风。
也能模拟被淹没的街道。
甚至能模拟公路上出现一头大象。
这些场景,车队从来没真正遇到过。
英国另一家公司 8 月发布的模型更进一步。
它把驾驶模型放进闭环。
它做出的决策不同,看到的路况就跟着变。
自动驾驶跑在前面,有它的道理。
数据最丰富。
需求最明确。
极端场景在现实里根本没法反复试。
机器人领域把它当成数据工厂。
几家人形机器人公司都是这套模型的早期用户。
用它批量生成现实中难采集的训练数据。
内容创作端,做三维和生成视频的团队也在靠它。
有家公司说,已有超过 10 万名开发者基于它的模型做产品。
主要集中在电商和直播。
国内厂商开源的那一套,直接瞄准游戏地图和关卡原型。
拿不完美的数据训练机器人,是外界最常见的质疑。
模型自己都不太懂物理。
拿它生成的数据去训机器人,等于在教错东西。
业内的看法正好相反。
合成数据的价值从来不在真。
而在便宜。
也在多样。
还在可控。
飞行员在模拟器里练发动机失效。
模拟器的手感和真飞机不一样。
可这些情况在真飞机上根本不敢练。
机器人也一样。
它们最缺的,恰恰是现实里采不到的数据。
这类做法已有实证。
今年一个顶级会议上,有项研究显示,只用世界模型生成的合成数据做后训练。
机器人在陌生物体和新指令上的成功率,从 38.7% 提到 83.4%。
企业对合成数据的用法也很清醒。
它们让传统仿真引擎保证物理和几何准确。
世界模型只负责把画面变逼真。
不过这条路还有几道坎。
第一道是数据。
大语言模型有整个互联网的文本可学。
世界模型面对的却是一块空白。
世上没有一个现成的物理互联网。
普通视频里没有力反馈。
也没有碰撞和物体交互的真实数据。
而这些恰恰是机器人最需要的。
第二道是误差。
有位院士在今年 7 月的大会上点出。
世界模型多步推演的误差不是线性累加。
它是按平方级放大的。
推得越远,崩得越彻底。
有研究机构测过一项基本功。
物体离开视野再回来,还在不在原处。
这对人来说近乎常识。
十个主流模型在这项测试里集体不及格。
满分 1 分,最高只拿到 0.58 分。
第三道是算力。
据业内估算,世界模型要的算力是同级语言模型的数倍乃至数十倍。
实时生成高清画面,往往要多卡并行。
最后是商业闭环。
包括李飞飞那家在内的头部公司,都没公开过营收。
技术能跑通,不等于客户愿意持续买单。
所以今天的世界模型,更像嵌在自动驾驶、机器人和内容流程里的一项能力。
它还不是一个能单独撑起一家公司的产品。
这笔钱买的不只是团队
再回来看这笔交易。
那家公司两年多累计融资约 12 亿美元。
放在软件赛道是天文数字。
放在前沿模型赛道,并不宽裕。
世界模型要处理视频。
要处理多视角和三维几何。
还要处理实时交互。
训练和推理都比语言模型更吃算力。
商业化也很现实。
第一款产品是款好工具。
它能把几张照片变成可漫游、可编辑的三维场景。
还能导出到主流游戏引擎。
用户主要是游戏、影视和头显团队。
可它属于渲染器这一层。
做的是一门工具生意。
李飞飞真正想做的空间智能,需要长期投入。
而且不计短期回报。
她在公告里说,推进下一代技术,需要模型研究,系统和计算紧密协作。
世界模型离不开算力。
与其排队买卡,不如直接加入。
她在官宣当天发了封公开信。
信的名字取自一首长诗。
讲的是一个不肯靠岸、执意再远航的老水手。
她还说,双方如果携手,就能创造一个软硬件互相加速的机会。
而在此之前,这家芯片厂在物理智能上一直是追赶者。
对手的仿真平台和机器人工具链经营多年。
世界模型也迭代到了第三代。
反观它自己,此前公开发布的主要是文本和视频模型。
在世界模型上只做过零星尝试。
更多是以投资人的身份押注几家初创。
今年它连做了四笔收购。
前面三笔都在推理效率和系统层面补课。
最后这笔,是第一次押注一个对手也没占稳的方向。
被收购的那几家里,有一家把模型直接刻进芯片。
现在它手里又多了一个前沿模型团队。
理论上有了新的可能。
不再只是硬件适配模型。
而是由模型来定义硬件。
只是世界模型几个月迭代一代。
芯片一旦定型就改不动。
这条路能不能走通,还要打个问号。
很多人分析,它花 82 亿美元买的,是提前几年看清算力需求的能力。
芯片从定义到量产要三到五年。
看懂未来负载当然重要。
但如果只是想看清需求,合作就够了。
双方从 2025 年就开始在它的显卡上联合优化。
李飞飞年初还上过它的发布会舞台。
花这个价全资买下,它要的第一样东西是排他性。
对手同样是那家公司的投资人。
收购之后,这支团队只属于它。
第二样,是补齐对标对手的拼图。
更长远看,是要拿到定义需求的话语权。
苏姿丰在采访里说得很直。
你对端到端流程了解得越深,越能做出更好的系统。
谈到目标时她说,未来会同时有开源模型和专有模型。
这家芯片厂的雄心,是定义未来计算的形态。
当年对手的护城河不是预测出来的。
是在一场场比赛和一代代研究者手里养出来的。
它想复制的正是这个过程。
让下一代负载,从一开始就长在自己的芯片和软件上。
这笔交易全部用股票支付。
是后来者以小博大的打法。
也让它的扩张高度依赖自己的股价。
收购完成后,这条赛道的主要力量,几乎都和一家算力巨头绑在了一起。
对手自研了世界模型,同时投资了一堆初创。
搜索巨头有自己的方案,并已在自动驾驶上落地。
云厂商则用自研芯片,把两家初创签成了客户。
如今,李飞飞的公司归了另一家芯片厂。
还保持独立的头部公司没剩几家。
它们大多也已经和某个算力阵营产生关联。
中立的世界模型公司,正在变成稀缺品。
对研究本身,这笔交易也会带来变化。
双方在交易当天的联合受访里都说,这个领域还在非常早期。
未来的竞争在于软硬件的协同进化。
模型和芯片的协同设计会加速。
世界模型的计算特征和语言模型差别很大。
它要同时处理大规模视频。
要处理多视角空间信息。
还要处理三维几何和低延迟交互。
当模型团队第一次能直接参与定义芯片,算力这道坎有可能从硬件端松一松。
三维路线也拿到了一张长期饭票。
李飞飞在公开信里承诺。
要在新东家内部建一个能持续数十年的前沿研究组织。
并坚持提供广泛可访问的开放模型。
不必再按融资周期赶进度。
不过这笔交易没有给路线之争下结论。
世界模型的技术路线至今没有收束。
也没有真正跑通。
收购证明的是团队和品牌值钱。
不是三维路线就是终局。
对做 AI工具 的团队来说,这里有个更朴素的提醒。
当一项能力的上限被算力锁住时。
先被收编的,往往是那个讲得最清楚的团队。
