一个工程师用 AI编程 写完数据处理代码,点下提交,然后去喝了杯咖啡。十几分钟,有时几十分钟,他才回到屏幕前看结果。改代码。再提交。这段等待的空隙,过去一直是数据平台默认的节奏。
智能体没有这个空隙。
它拿到一次结果,立刻验证。接着并发去试第二种和第三种方案。反馈来得飞快。它马上发起下一轮调用。人用平台,交过来的是一个确定的任务。算完给结果,人就走了。智能体用平台,会不停换着法子去完成你交代的那个目标。管控的压力和隐形的计算压力,就这样往上翻。十倍。百倍。
这正在成为 2026 年云计算要面对的一种新负载。
模型一旦长成智能体,它就不再是躺在那里等你调用的接口。它更像一个数字员工。会自己找数据。会自己拆任务。会自己并发试错。还会一直跑下去。它造出来的负载,和过去十几年云平台习惯承载的那种,完全是两回事。
阿里云智能集团首席技术官李飞飞在云栖大会上把智能体落地拆成三个词。模型决定智能的上限。上下文决定它读不读得懂你的业务。执行框架决定它能不能调起工具,能不能把事做完,还能一直跑下去。光把一个模型做大做强,远远不够。
数据流动起来产生智能,智能以智能体的形态落进业务。业务跑起来又产生新的数据,产生新的负载,回过头推着整个系统往前走。这个飞轮转得快不快,取决于三件事。模型生产的效率。智能落地的效率。系统自我进化的效率。
今年云栖大会,阿里云沿着这三个效率,把整条链路一次性升级了一遍。从数据入湖,到训练集生产,再到模型训练和推理服务,最后到系统自己优化自己。贯穿这些升级的,是它强调的「芯云模一体」。让芯片、云平台和模型走向协同设计。
模型走进真实世界,数据先成了瓶颈
AI 进入物理世界之后,数据先变了。
过去的大模型主要处理文本和代码。自动驾驶和具身智能面对的是另一套东西。视频。点云。运动轨迹。还有传感信号。原始数据不难攒。难的是清洗,是质检,是标注,最后还要转成模型能用的训练集。
穹彻智能首席科学家吕峻提到,具身智能的数据以视频和点云为主。从采完到进训练,中间可能过几十道处理。一次数据版本迭代,短则两周,长则一个月。存储、数据处理和模型训练之间只要有一个环节接不上,整个实验周期就被拉长。
长期看,这个领域可用的数据规模可能还差两三个数量级。吕峻觉得,眼前更直接的问题已经转向数据质量。哪些数据真正有效。怎么做精细标注,怎么做前后质检。算法能不能把这些数据变成模型能力。问题就卡在这。
数据的生产方式也在变。人工标注要组团队,要培训,规则一改还得重调流程。模型辅助标注迭代更快。人可以从标注里抽身,集中到质检和高难度样本上。对做具身智能的公司来说,这不只是省成本。它还决定了模型实验能不能跑得够频繁。
阿里云对数据计算平台的升级,针对的正是这条生产链。新的平台把处理器、显卡和大模型的词元放进统一调度。它可以直接调用模型处理图片和文本。面向自动驾驶和具身智能这些场景,还能把数据管线封装成技能插件。开发者用自然语言就能组织处理任务。
配套的计算引擎支持多种全模态框架,也和主流的开放湖表格式连通。按阿里云公布的数据,这套方案能让具身智能的数据处理耗时减少 40%。海量原始数据可以直接生成两种标准训练集格式。
数据备好,问题就到了训练端。新的训练平台对算力底座、训练框架和任务运行状态做联合分析。它自动定位通信、数据读取和资源调度里的问题。阿里云公布的测试结果是,多模态模型端到端训练速度提升了 2.4 倍。代价很直接。
这类优化越来越依赖芯片、云平台和模型之间的协同。
阿里云智能集团研发副总裁汪军华举过一个例子。一种模型架构即便效果足够好,也可能和硬件对不上。芯片缓存要对得上。通信方式要对得上。推理框架也要对得上。只要有一个不匹配,落到真实硬件上就要付出很高的成本。基础设施由此进入更强调联合设计的阶段。模型架构要理解硬件,计算平台也要理解模型怎么工作。

对企业来说,模型能力的形成已经是一条连续生产线。原始数据处理得够不够快。训练问题能不能及时定位。算力能不能随任务灵活调度。这些都会影响模型迭代的最终速度。
智能走进应用,平台的使用方式被改写
模型训练完成,只回答了智能从哪里来。智能体进企业,还要先学会怎么用数据。
企业数据通常散在数据湖和数仓,还有搜索和实时计算系统里。不同部门对同一个指标可能有不同口径。规则藏在字段背后。智能体就算找到了数据,也不一定知道它讲的是什么,更不会在生产环境里随手改和删。
这就是它和传统数据工具的差别。过去工程师理解数据结构,也知道一次操作会带来什么影响。智能体靠上下文、语义和权限系统去做判断。这些信息一缺,它越自动化,风险反而越大。差别就在这里。
阿里云这次让开放湖仓往「智能体湖仓」的方向走。湖仓继续承载统一、实时的全模态数据,湖上的计算引擎通过技能和接口向智能体开放。配套的数据治理平台提供跨引擎的语义层和任务编排。智能体可以围着业务目标去组织数据处理。
新发布的原生大数据服务更进一步,走多智能体协同。用户从一个自然语言入口提问。系统再调动离线计算、实时分析和搜索等不同引擎。把分析、工程和运维的活分下去。
自然语言把门槛降下来了。写代码才能用的 AI工具,现在一句话就能调起来。安全治理也被往前推了一步。阿里云大数据和人工智能平台解决方案负责人魏文提到,智能体可以有很高的自主性。但涉及数据的增删改查这些高风险操作,需要在可控、可回滚和可审计的数据沙箱里跑。

数据权限体系得跟着细化。往后要管的,不只是某个员工能不能看一张表。还包括智能体在什么任务下能调用哪些数据,能执行到哪一步。出了问题由谁接管,也要说清。
智能体的运行方式同样在改推理基础设施。它可能围着一个任务工作几小时,连续调用多个模型和工具。请求量随任务阶段剧烈波动。企业盯的指标因此从单次生成速度,扩到冷启动、缓存和扩缩容。再扩到服务稳定性和整体成本。
新的推理服务用智能路由、缓存感知调度和模型预热这些能力,去接住智能体的持续负载。配套的强化学习服务,则让企业用真实任务轨迹继续训练自己专属的模型。这不便宜。
在直播和风控这类实时场景里,数据和行动之间的距离还要再短一点。流式计算能接住视频、音频和事件流。它还带动态编排和长中短期记忆。央视体育的实时解说就是一个例子。智能体要同时看懂画面、声音和赛事事件,再生成跟比赛进程对得上的解说。反应要快。
数据语义、权限治理和推理服务连到一起,再加上实时计算。智能体才算具备了进真实业务流程的基本条件。
从应用回到进化,运行反馈成了新燃料
智能体进了应用,会持续造出新的数据,新的任务轨迹,还有新的计算负载。接下来的问题是,系统越来越复杂,基础设施自己能不能跟上。路还长。
大规模训练和数据查询的优化,过去高度依赖专家。工程师要盯任务状态,定位数据读取、通信和查询计划里的瓶颈,改完参数再重跑。这套办法适合相对稳定的负载。智能体发起的任务更频繁,组合也更复杂。人工调优很难覆盖所有变化。很难覆盖住。与其一遍遍手动试,不如让系统自己记住哪种方案更有效。宁可多花点时间做闭环,也别指望一次调参就能一劳永逸。
汪军华描述过一种新的过程。智能体可以主动在训练任务里插入性能分析。找到瓶颈以后,再调用训练框架提供的技能,生成新的优化任务。任务跑完比一比结果,形成一份分析报告。整个过程从一次人工诊断,变成可以反复执行的反馈闭环。
有一个模拟工具体现了类似的思路。
万卡训练里的很多通信和配置问题,往往要到足够规模才暴露。直接拿真实集群试错代价很高。这个工具只用不到 1% 的显卡资源。它就能模拟万卡集群的训练效果,相当于给大模型训练造了一个风洞。按阿里云的内部实践,它给训练任务带来了 2% 到 10% 的算力利用率提升。
在数据查询侧,自进化的查询优化器会分析真实的业务负载。它提炼候选方案,过一遍正确性和性能门禁。再把有效的经验沉淀回系统。阿里云公布的数据是,它四个月里自主发现并完成了 28 项优化。优化器性能提升 100%。湖上查询性能提升 38%。
这些能力有个共同点。它们让应用产生的负载,变成系统优化的输入。系统能看见任务怎么跑,哪里卡住,哪种方案更有效。再把验证过的经验用到下一轮任务上。
穹彻智能的实践更接近业务结果。它用阿里云的几套平台搭了一条云上的数据加智能流水线。按阿里云公布的数据,数据处理吞吐提升超过十倍,模型训练效率提升约 50%。对还在快速试错阶段的具身智能公司来说,基础设施最大的价值很直接。它把原本以周为单位的数据和模型迭代,再压一压。
不过,基础设施的自我优化有明确边界。边界很清楚。
在科学计算场景里,无尽前延首席技术官张林峰有个判断。偏计算型的学科更容易被 AI 改造。因为数据、模型和结果都能在数字系统里流转。一旦进入生物实验、科学仪器和物理世界的操作,事情就复杂得多。科学软件效率不高,接口老旧,实验设备未必支持自动控制。智能体就算能设计任务,也很难独立跑完从计算到实验验证的闭环。
这恰好说明,智能体基础设施的价值不等于替企业完成所有创新。它能降低数据处理和模型试错的成本,缩短应用反馈进下一轮训练的距离。但数据质量、算法路线,还有行业软件和物理设备,仍然决定智能最终能走多远。
从数据产生智能,到智能进入应用,再到应用推着系统优化。阿里云想搭的,是一条一直转下去的反馈链。智能体时代,基础设施竞争的关键也正在换。从能承载多少模型,转向能不能让数据、模型和系统一起进化得更快。
