钱到位了,干活的机器却不多
2026 年,钱正往 AI 走进物理世界这条路上涌。
一家数据机构的统计显示,截至 5 月 11 日,国内具身智能领域今年已披露投资 218 起,金额超过 577 亿元。不到半年,就超过了去年全年的 357 起。
摩根士丹利年内第二次上调中国人形机器人出货量预测,从年初的 1.4 万台一路调到 5 万台。
抬头看,赛迪顾问预测中国低空经济市场规模今年将突破 1 万亿元。低头看,有机构测算今年中国自动驾驶市场规模会达到 5293 亿元。
英伟达创始人黄仁勋把物理智能叫作下一波浪潮。海外一家机器人公司在宝马工厂完成了 1250 小时真实生产作业。看起来,这波进军的势头挡不住。
过去几年,AI编程 这类事越做越漂亮。写代码,改文档,出张图,都算。
可它们基本都发生在屏幕里。
AI对话 也是这样。问一句答一句,顺手得让人习惯了。
账本的另一面没那么好看。
摩根士丹利的拆解显示,去年中国出货的人形机器人里,42% 流向研发与教育,19% 去了互动展示,19% 做数据采集,真正在工业物流场景干活的只占 4%。
钱投了。货也出了。物理智能为什么还是没法规模化上岗。
9 月 18 日,华为在全联接大会期间联合中国信息通信研究院和中国科学院沈阳自动化研究所,还与全球计算联盟、安永(中国)一起发布了一份报告,《物理智能云边端协同架构研究报告》。
报告的核心判断很短。物理智能必须从单点瓶颈走向系统进化。系统进化的路径,是云边端协同。

单点跑得快,不等于体系能干活
在谈困境之前,得先弄清楚什么是物理智能。
华为在报告里的定义是,AI 在真实物理世界里跑完一整套闭环的能力体系,从感知到理解,从推理到规划,再到行动和反馈。载体包括机器人,包括自动驾驶和智能空间,也包括工业自动化设备。
无人机的航线规划算一类。自动驾驶的实时决策算一类。工厂里的工控优化、楼宇里的能源调度也算。只要 AI 要感知物理世界并对它动手,都归到这里。
表现形态差别很大。它们面对的却是同一套底层难题。实时性和复杂性,很难同时满足。
华为负责新机会孵化的计算领域总监罗云峰把话讲得很直接。AI 入端,是物理智能落地最大的瓶颈。
在端侧,主流机器人本体处处受限。算力有限。功耗有天花板。成本下不来。空间就那么点。
在云侧,大模型上云的推理时延满足不了毫秒级工业控制。机器人本体和无人机本体的多维感知,又对上行带宽提出很高要求,而传统网络一向以下行为主。赶上弱网或者断网,纯云端方案还有瘫痪风险。
更根本的问题在任务本身。感知跑一个频率。决策跑一个频率。执行再跑一个。协同和学习又是另外的节奏。同一个节点根本兜不住整条闭环。
华为新机会孵化部总裁翟广雷举了个例子。博尔特跑百米用 9.58 秒,机器人能做到 9.36 秒。人类背式跳跃在 2.4 米左右,机器人今年已经能跳到 3 米多。可机器人在生产线上连拧螺丝都吃力,因为精密制造要细到 0.1 到 0.2 毫米,这就得靠视觉,靠触控,靠力控,还得有灵巧手配合。
跑得快、跳得高是性能。拧得稳螺丝是能力。性能可以靠单点堆出来。能力只能靠体系。
既然单点同时满足不了这两头,那就让三层各管一段。与其把算力全堆在机器人本体上,不如把任务拆开,让每一层只做自己最擅长的事。
端侧盯的是微秒到毫秒级的实时感知和高频运动控制,解决快和安全。边缘侧当区域中枢,负责数据汇聚,负责本地模型微调,负责多机协作和弱网自治,解决稳和联。云端当全局大脑,管大模型开发,管全局规划,管运营,解决强和智。
通过分层协同把对单点算力的依赖降下来,同时兼顾确定性时延和复杂推理,也照顾多机协同与全局优化。这是物理智能规模化落地的系统路径。

三域协同,还要一张网兜住
云边端协同具体怎么做,报告给出的主张叫「三域协同·一网贯通」。

三域协同对应三条流动主线。任务怎么在云边端之间拆分与调度,算一条。数据在本域怎么对齐,跨域怎么共享,算一条。算力怎么统一调度,让开发者用起来没有感觉,算第三条。
对 AI工具 来说,这条链上任何一环掉链子,整台机器就动不了。这也是报告反复强调协同的原因。
数据这条最琐碎。视觉要标,力觉要标,触觉也要标,时空标定缺一个都不行。
这些协同能成立的前提,是三层之间连得上、通得畅。这就是一网贯通要干的事。
它用三张网盖住物理智能全域。端内网保障从智能到机电的毫秒级传导。端间网支撑多台机器之间点对点协作。端云网负责数据和指令上下互通。

底层靠的是几项通信技术的融合。星闪用微秒级时延和超高可靠性,负责机器人本体内部传感器与控制器的无线互联。工业以太总线把产线上精密设备的同步抖动压到亚微秒级。5G-A 靠大上行和毫秒级时延,把海量感知数据回传,再把调度指令发到现场。时间敏感网络当统一的有线骨干,为前面几路流量提供确定性调度和时间同步。
网络在这里换了身份。以前它连接的是设备。现在它连接的是任务和智能能力。它是整套架构的地基。
智能走进物理世界,还得有够多够好的数据。
智元机器人具身业务部总裁姚卯青在世界人工智能大会的演讲里提到,具身智能行业普遍卡在三道墙上。数据是一道。表征是一道。闭环是一道。
报告的破解办法是一个数据飞轮。真机作业数据回流到云端做训练和评测,优化后的模型再下发到边端。转一圈,能力就往上走一层。
数据来源也得凑齐三类。真实数据提供物理真实性。仿真数据提供规模。生成数据提供变体。
为了让架构能落地,报告还给了四条设计原则。分层解耦,协同自治。实时优先,智能协同。弹性调度,资源最优。开放兼容,持续演进。
还有一点容易被漏掉。当智能体开始在物理世界里动手,安全机制本身也得云边端协同。
落地要一步一步来
架构的解法清晰了,落地还得按步骤走。报告把进程划成三个阶段。
近期是边缘按需部署,以端加云为主,先在零售和巡检这类场景跑通。中期落在 2028 到 2030 年,走向区域自治,边侧增加一脑多机,端侧增强一机多脑。远期走向动态协同,形成一个一体化的分布式智能网络。
场景的顺序也有讲究。物理智能要优先在制造和物流这类结构化专业场景落地,能源和商业服务也算在内。然后再往家庭服务、城市物流这类开放复杂场景走。
华为制造与大企业军团副总裁王剑伟的判断是,具身智能现在很像 2017 年、2018 年自动驾驶刚起步的阶段,这个产业周期还需要 3 到 5 年才可能规模化落地。
「三域协同·一网贯通」这套模式,已经有样板跑出来了。
今年世界人工智能大会期间,华为与国家地方共建人形机器人创新中心发布了首个具身智能实训场样板点,麒麟训练场。这也是全国首个异构人形机器人具身智能训练场。

这个样板点做的是同一件事。把教机器人干活变成一条工业化流水线。
云端用超大规模智算集群做预训练。边缘节点顶实时推理。端侧低功耗芯片管本体运动控制。更关键的是闭环。模型部署到端侧真机以后,云端会持续盯着运行状态,把数据和问题收回来,喂给下一轮训练。
报告说的那个数据飞轮,在这里完成了第一次规模化实践。
从这套体系里练出来的机器人,已经进了汽车制造和智慧零售这类场景,城市环卫和特种作业也在名单里,在工业侧,在民生侧,在特种作业侧,各做一轮验证。
物理智能是一场系统工程。它横跨芯片和基础模型,也横跨通信网络、真实世界数据和行业落地场景。
想让 AI 从数字空间走进真实物理环境,把感知、决策和执行的闭环跑完,只靠优化单点场景已经不够了。只迭代单项技术,同样不够。
跨层协同和异构调度这些关键技术还在探索期。物理智能最后拼的,是系统整体协同和持续进化的综合能力。
宁可先在一个车间跑通,也别一上来就铺满全厂。这类工具要真上岗,靠的是一层一层把账算清。
