vivo 解 AI 手机这道题:端云模型分档调度,系统级 Harness 补上执行闭环

手机上的人工智能越来越强。用户却未必觉得更好用。这两件事正在分头走。

一条航班延误的推送弹出来。让人工智能总结内容,说说晚点多久,它做得不错。可要接着往下办,事情立刻复杂。转机要不要改签。酒店会不会白订。明早那场会还能不能赶上。这一连串任务,得有人替用户接下来。

更麻烦的是习惯。你愿不愿意坐凌晨的航班。多花几百块你在不在意。第二天那场会能不能迟到。它得先知道这些,才敢替你决定。

于是我们看到一种熟悉的场面。人工智能好像什么都会一点。真遇上事,最后还得自己动手。

AI 能力与用户体验之间的落差

这就是 AI 手机这两年的落差所在。模型能力一路往上走,跑分榜单卷得热闹。手机端的体验没有跟着自动升级。落差挺大。

一台手机真想替用户把事接过去,光听懂一句话远远不够。它得在用户授权的范围里,知道你此刻在做什么,记得你此前做过什么。还要把合适的模型和上下文调起来。把相关应用与服务串起来。然后一环接一环办完。

走到这一步,手机要解决的不再只是模型能力问题。它考的是感知和记忆,也考调度、执行与协同。难度换了一个层级。

手机面对的是系统题而非模型题

刚刚结束的 2026 vivo 开发者大会上,人工智能分会场给出了技术路径。它正对着这道题。这个底座是大模型加 Harness(可以理解为执行框架)。再拿它去重构系统体验。目标只有一个。让手机真正理解用户。

先看模型这一层。今天再谈智能体,端侧已经绕不开。市场调研机构 Counterpoint 给了一个预测。今年生成式人工智能手机的出货占比会到 45%。去年这个数字还是 36%。

手机又一次站到了风口。原因很朴素。在所有终端里,它离人最近。它也掌握着最完整的个人上下文。屏幕上正在看的内容,相册,位置,应用使用习惯,都围绕这块几英寸的屏幕发生。

但有个规律。一种技术离真实世界越近,约束往往越多。当人工智能真正进入个人设备,时延,成本,隐私,能力,就被压进了同一道选择题。

复杂推理和长链路任务需要更强的模型。代价是更高的成本和更长的响应时间。本地小模型足够快,足够轻,能力上限又更早出现。更麻烦的是一项真实任务经常横跨两端。

一个模型包打天下的老办法,有点走不通了。

单模型难以兼顾所有能力

类似的难题,芯片行业早就碰过一次。计算任务越来越复杂之后,单靠中央处理器扛下所有工作,很快撞上功耗和效率的天花板。

最后跑出来的答案是异构计算。中央处理器负责通用控制。图形处理器接管并行计算。神经网络处理器专做人工智能。图像信号处理器负责成像。系统根据任务不同,把计算动态分配给最合适的单元。

也就是说,不是让最强的单元干所有活。而是让最合适的单元干最合适的活。

落到端侧模型上,vivo 给出了一个很符合终端厂商身份的解法。多数大模型厂商忙着训练一个更强更通用的模型。vivo 更关心的是,怎么给每个人在手机上组织出一套属于自己的智能。出发点就不一样。

既然一个模型没法平衡所有能力,不如让多个模型各司其职,自动调度,实现端云协同。

多模型各司其职与端云协同

今年大会上亮相的蓝心大模型端云矩阵,本质上做的就是这件事。

从识别声音到理解语义、语气和意图,交给端到端的语音大模型。需要长期驻留在设备上的感知与记忆,由端侧小模型承担。信息查询,日程管理,跨应用操作这类高频场景,交给云侧的快速模型。碰到复杂推理和长程规划,再交给云侧的大模型接手。

进入专业领域之后,系统还能继续调动外部更强的模型补位。模型开始组团。它从一个需要用户主动选择的产品,退到后台,成为被系统自动调度的基础能力。

模型退到后台成为基础能力

但一个长期运行在个人设备上的智能体,还会遇到第二道更难的题。人本身就是一种不断变化的上下文。

人工智能真正要理解的,从来不是一条孤立的指令。而是一个人此刻所处的状态,加上此前一路留下的轨迹。它得懂当下,也得懂过去。

随之而来的是另一道更棘手的问题。隐私和权限边界怎么划。

个人智能想越用越懂你,就得持续感知设备上的信息。它还要逐渐积累日程,位置和操作习惯。

但感知范围越广,记忆时间越长,涉及的个人信息也越多。权限管理和隐私保护的压力同步上升。

所以个人智能真正难的地方在于,要同时解决两件看起来矛盾的事。既让智能体拥有足够连续的个人上下文,又让这些感知和记忆始终运行在明确的授权边界之内。

围绕这个痛点,vivo 把目光押在两个关键词上。感知,还有记忆。在用户授权和隐私保护的前提下,把一次次零散的端侧交互,慢慢拼成对一个人的长期理解。

面向感知,端侧小模型用轻量视觉编码器加界面专用词元。它高效理解屏幕内容。也看懂图像和视频。文本同样读得懂。面向记忆,则靠几项底层技术优化,把端侧能记住的上下文拉长到三万多个词元。

感知不断沉淀为记忆。记忆又让下一次服务更贴合你的需求。一套越用越懂人的个人智能飞轮开始转起来。

感知与记忆形成个人智能飞轮

当一个智能体能看懂你此刻在做什么,记得你过去做过什么。它还能在不同任务之间找到最合适的模型和能力。所谓个体专属助理,才真正有了「个体」二字的分量。

模型能力解决的是会不会的问题。智能体真正进入系统之后,还要面对一件更现实的事。它能不能把一个任务从头到尾自主做完。

软件行业过去把这些统称为工程。到了智能体时代,工程有了一个更时髦的名字,Harness。

有意思的是,同样叫 Harness,大模型厂商和终端厂商要解决的问题并不在同一个层面。大模型厂商围绕模型展开。他们想的是怎么让智能体稳定调用工具。怎么保持更长的上下文。怎么跑更久的任务。还有怎么在沙箱里安全执行。

到了手机这边,问题要再往系统深处走一层。手机面对的重点,是怎么让人工智能执行过去由用户自己完成的那套操作流程。这一步更难。

终端厂商面对的执行问题更深一层

过去十几年,智能手机建立起来的是一套以应用为中心的服务秩序。打车要先找到打车软件。订酒店要打开旅行应用。换句话说,过去的系统核心任务是让成千上万个应用稳定共享算力和存储,分好网络与硬件资源。

智能体进入终端之后,应用依然承载具体服务。但用户与这些服务打交道的方式变了。智能体的执行过程天然会穿透应用边界,连续调用不同服务,继承上下文。原本被应用边界隔开的能力,开始需要在一次任务里被动态组合。

越来越多智能体都要处理意图理解,服务调用和跨设备协同。这些能力不该再被每个应用和开发者重复造轮子。

也正是在这套终端范式开始松动的时候,vivo 把其中一层关键能力提前收进了手机系统。他们做出一套智能体原生的系统级 Harness 开发者平台。应用时代的能力孤岛,就此改造成智能体时代的公共基础设施。对写 AI编程 的人来说,底层的对接活少了一大截。

具体到分层。感知和记忆层负责理解用户与环境。前者靠多模态信息获取当下状态。后者沉淀场景、偏好和历史交互。不同智能体因此共享长期上下文。

规划层负责路由,任务编排和反思优化,并持续调整执行路径、词元用量与成本。

执行层借助六千多个系统级工具。还有 MCP 和 A2A 这类协议,加上命令行与统一接口。它把模型、智能体和外部服务接进手机。也接进物联网设备。最后接进现实世界。

理解,规划,调用,执行,由此形成一个闭环。底层的苦活被系统吃掉之后,开发者才终于能把时间花在真正值钱的地方。

理解规划调用执行形成闭环

这套平台还得解决一个行业里非常现实的问题。经验怎么留下来。

人干同一件事十次,多少会学聪明一点。智能体今天绕八个弯完成任务,明天还原样绕八个弯,那它充其量是个拥有无限耐心的实习生。

在这套系统级 Harness 里,自进化的能力被做成了一套具体的运行机制。基于观察、反思和沉淀的框架,系统可以在用户授权下持续学习行为和反馈。它还能利用设备闲时复盘任务路径。新的经验会重新沉淀进系统能力。

与此同时,统一的意图入口也来了。跨设备的运行环境也有了。上下文可以随行。任务因此能在手机、电脑和平板之间接着跑。MCP 和 A2A 这类协议再负责让智能体、模型和工具彼此接力。

这意味着个人智能长期积累的东西,开始从静态的用户信息,延伸到动态的执行经验。

当系统层足够成熟,开发者要做的事只剩一件。动手就行。

系统足够成熟后开发者只剩动手

过去几年,行业花了大量时间研究怎么降低词元成本。到了智能体时代,另一项成本可能会越来越贵。协调成本。

放在当下这个节点看,协调成本正在迅速变成一项显性的系统成本。能力越多,调度,上下文,权限和执行链路就越复杂。模型能力越强,系统工程的重要性也跟着往上走。

最后真正决定体验的,还是那条越来越清楚的分工。模型决定能力上限。系统决定这些能力最终能兑现多少。

互联网过去二十年的商业史,某种程度上就是一部抢入口的历史。门户时代抢首页。搜索时代抢关键词。移动互联网抢桌面图标和停留时长。超级应用再把越来越多服务收进自己的围墙。

但智能体出现之后,这套规则有些不适用了。当用户只需要说一句帮我订一家川菜餐厅,他已经不太关心背后打开了哪个应用,调用了哪个服务。局面变了。

应用时代争的是入口。智能体时代开始争的是谁能更靠近用户意图。这也是为什么今年主流的编程助手和各类技能协议,都在往意图核心靠。

入口之争转向意图之争

在一众全球主流人工智能公司里,vivo 的身份有点特殊。它是一家终端厂商。它在生态层给自己的定位显得有些克制。他们不想做一个包办所有服务的全能选手。他们把自己放在意图和服务之间,做一个搭桥人。一头连着具体的智能体服务。另一头连着真实的用户需求。

蓝心小 V 升级到专业模式之后,vivo 想做的就是把这层连接成本压到最低。开发者接入一次,能力就能被系统在不同入口里统一理解,统一调度,统一触达。

智能体,技能,协议和端侧的原子能力,也被逐步纳入同一套底座。意图服务的竞争单位,开始从一个完整的应用,逐渐下沉到一项项可以被智能调度的能力。这意味着移动互联网十多年建立起来的应用边界,开始松动。

2008 年苹果上线应用商店时,真正把手机变成平台的,是一批批第三方开发者。从游戏到社交,从打车到支付。这个商店好不好用,很大程度取决于外部服务能在系统里长出多少新能力。

平台比的是连接效率。生态共建比的是协同深度。真正能把生态做厚的,还是第三方伙伴有没有在里面跑出新的产品形态和真实结果。对做 AI工具 的团队来说,这一点尤其要紧。

在这件事上,这家终端厂商长出了不少具体注脚。民生服务场景里,vivo 联合支付宝重做终端服务形态。能力被拆成服务直达、服务执行和 MCP 技能。更多生活服务一句话就能办完。

本地生活领域,美团把吃喝玩乐等能力接进了小 V,通过智能体串起原本分散的服务入口。出行场景里,小 V 和高德地图深度联动。一句话就能完成导航、路线规划和地点查询。

电商消费端,京东打通了跨应用圈选,多模态识别,商品搜索和支付这一整条链路。刚刚结束的大会圆桌上,来自京东和支付宝的合作伙伴发了言。他们分享了智能体服务在终端落地时遇到的真实问题。也讲了生态协同带来的新解法。

这些,正是终端生态从把服务接进来,继续走向让服务真正跑起来必须补上的一环。

第三方生态的协同注脚

技术赋能到底有没有价值,还要看它有没有照顾到那些容易被忽略的需求。2021 年,vivo 发起了「声声有息」公益计划。至今他们已经开放 27 项无障碍功能。覆盖超过 110 万残障用户。

他们的多模态手语大模型用了八千多个国标词汇和一百万段视频训练。它从单个手势识别走向连续手语理解。现在已经用在实时翻译和手语学习上。

当人工智能开始听懂那些过去常被系统遗漏的表达,所谓个人化智能也就有了更有温度的意义。

个人化智能的温度

今天再聊端侧,手机,模型和执行框架,会发现几者之间的界限正在变得越来越模糊。模型进入系统,系统接管执行,端侧负责理解和记忆,云端补足更复杂的能力。

但站在用户这一边,所有技术名词最后都会收敛成一个很简单的体验。能不能真正懂我,能不能帮我办事。

真实生活从来不是一道孤立的指令。它是一连串习惯,偏好,临时变化和前后关联的小事。

用户不需要知道背后跑的是端侧模型还是云端模型。也不需要理解那些协议和框架分别做了什么。他只会慢慢发现,很多事情不用再从头解释,很多操作也不用再自己一层层点下去。

这或许就是个人化智能更实际的一层含义。人工智能开始从理解一条指令,走向理解一个具体的人。

vivo 这次给出的大模型加执行框架路径,最终要缩短的正是这段距离。让模型能力穿过系统工程,真正落到每一次具体的日常需求里。手机也就不再只是一个装着人工智能的设备。它开始有点像一台只属于你的助理。