浏览器正在换一种身份。
它以前是人打开网页的工具,现在成了智能体操作数字世界的手。
用户不用再逐个进网站找菜单,也不用复制粘贴信息。
只要说一句,比较几家供应商,把申请表填好。
剩下的交给它。
它看见页面,理解目标,然后动手点击和输入。
这类演示很抓人。
看多了容易得出一个激进的结论:应用不重要了,软件全退到后台,人只和一个 AI对话 就够了。
这个结论下得太快。

浏览器正在从人的工具,变成智能体操作数字世界的手
一、演示里的顺利路径,不是真实工作
把演示搬进真实工作,画面立刻变样。
页面改版了。按钮重名了。登录过期了。弹窗盖住了入口。验证码弹出来。网络超时了。
最麻烦的一种情况是,智能体根本不知道订单到底成功了一次还是两次。
旧式自动化当年许下的承诺,也是自动操作所有软件。
它同样被这些问题折磨了很多年。
新一代浏览器智能体确实更聪明。
可它并没有让数字世界突然变得确定。
它改变的是自动化能覆盖的范围,也改变了人使用软件的入口。
底层的应用和业务接口,一条都不会消失。
二、这一代为什么更接近可用
老一套流程自动化,最早就是 AI办公 场景里的固定脚本。
它靠固定坐标、选择器或者预先录制的操作轨迹。
页面结构一变,脚本就可能失效。
适合规则明确、高频稳定的后台操作,却很难处理描述模糊的任务。
新方案多了三样能力。
先是视觉和语义理解。
它不再只找一个坐标,而是能认出「提交订单」「下载对账单」这些按钮的意思。
按钮换了位置,只要界面表达还清楚,它照样有办法完成。
然后是动态规划。
遇到缺字段、页面异常或者多出来的中间步骤,它可以重新判断,而不是当场报错。
用户只给目标,路径由它自己决定。
最后是跨应用上下文。
它能从邮件里读出订单号,去浏览器查物流,再把结果写进表格。
老方案也能跨系统,但每条路径都得工程师提前写好。
新方案可以在运行时临时组合。
今年 Google 把 computer use 直接做进了 Gemini 3.5 Flash。
这说明这项能力正从实验模型变成通用底座。
发布说明里提到,模型可以在浏览器和桌面里识别并执行动作。
OpenAI 和 Anthropic 也在往同一个方向推。
变化的关键只有一句话。
自然语言目标和界面操作之间,第一次有了相对通用的翻译层。
三、应用还在,只是界面退到第二排
应用不只是用户看到的按钮和页面。
它背后还有数据库,有权限,有交易,有业务规则,也有审计状态。
就算人不再亲手打开它,这些系统仍然要保存事实并承担结果。
被削弱的其实是另一种模式:每个任务都必须由人进入专用界面完成。
过去,员工要学十几个后台系统。
以后智能体可以成为统一入口,底层应用更像服务和事实系统。
人只在处理例外或者做复杂判断的时候才进去。
这和搜索引擎没有消灭网站是一个道理。
搜索改变了人到达内容的路径,却没有替代内容本身。
界面可能减少用户在应用里停留的时间,但数据一致性必须保证,权限和履约仍然归应用负责。
甚至可以说,当智能体成为主要操作者,底层应用的工程质量会变得更重要。
人看到一个含糊报错,可能凭经验换个路径。
智能体拿不到结构化错误,就容易反复点击或者错误推断。
稳定的接口,可重放的幂等操作,清楚的状态,比漂亮的动画更能决定一款软件是否适合机器操作。
四、两者不是替代关系,是一条降级链
把 AI 浏览器说成流程自动化的终结者,并不准确。
两者解决的是同一类问题:在没法直接整合的系统之间,让机器替人去操作界面。
差别在适应性和构建成本。
老方案的优势是确定。
一条测过的流程可以精确限制每一步,跑得快,资源消耗也好预测。
它的弱点是脆弱和昂贵。
流程稍变就要维护,长尾异常基本覆盖不到。
新方案的优势是弹性。
它能理解变化,也能处理非标准输入,部署一个新任务不一定需要写完整脚本。
它的弱点是结果不稳。
同一个页面可能走出不同路径,复杂任务更费时间,错误也更难复现。
成熟的系统不会在两个里选一个。
稳定高频的路径仍然交给业务接口或者确定性自动化。
交给模型的是理解目标、处理长尾异常这类事。
视觉点击只在完全没有接口的时候用,作为最后手段。
这条从确定到灵活的降级顺序,比让模型从头到尾看图点鼠标更可靠。
如果接口已经存在,还让智能体逐页去点,等于用不确定性换表面的通用性。
五、最容易被忽略的是结果验证
演示通常停在最后一个按钮被点击。
生产系统关心的却是目标状态。
假设智能体在买一张机票。
点了付款之后页面超时,接下来要不要重试,就成了一个难题。
如果第一次其实已经成功,第二次点击就可能重复扣款。
页面显示「正在处理」,它还得判断该等多久。
订单生成之后,看到绿色提示还不能算完成。
它必须去订单系统里确认编号,再核对邮件和支付状态是否一致。
这些问题不能靠视觉模型猜。
凡是会产生副作用的动作,都需要幂等键,需要执行前检查,也需要执行后验证。
查页面可以宽松一些。
付款和发送必须严格。
删除和提交也是。
服务端支持幂等键时,超时后的正确动作不是再造一个新请求。
它应该先用同一个键去查,看这笔业务意图是不是已经成功。
教科书里的做法就是保留同一个键,把「网络没返回」和「业务没执行」区分开。
不是所有网页系统都提供这种查询能力。
没有幂等支持的时候,智能体应该拿订单号、金额这类业务字段去核对。
还是确认不了,就停在未知状态,而不是用一次盲目重试去赌结果。
身份是另一个难点。
智能体用的是谁的登录状态,它被授权访问哪些账户,这些都要先定清楚。
浏览器里的 Cookie 往往带着比当前任务更大的权限。
如果它碰到网页里的恶意提示,就可能把整个会话用到错误的地方。
权限应该绑定到具体任务和动作上,而不是把用户整套浏览器配置都交给模型。
还有人和机器之间的交接。
遇到验证码、双因素认证这类关卡时,系统应该把准确的上下文交给人。
好的交接会展示当前页面,说清已经完成的步骤,再把待决定的问题和可选项摆出来。
人处理完,智能体接着往下走。
衡量这类产品也不能只看完成率。
还要看平均要多少步,重试了几次,人工接管率有多高,有没有重复副作用,页面改版后还能不能恢复。
失败的时候,能不能说清自己停在哪里,同样要记。
六、哪些场景会先变
第一类是低风险、跨系统的信息工作。
收集公开资料,下载报表,把几个后台的信息整理成一份摘要。
这类任务出了错很容易发现,通常也不会直接对外做出承诺。
第二类是企业内部的遗留系统。
很多旧软件没有现代接口,重新开发的成本又高。
模型可以先当一层适配,减少员工重复操作,但前提是跑在受控账户和隔离环境里。
第三类是个人长尾任务。
订票、比价这类流程各不相同,老办法很难为每一种需求写脚本。
理解能力在这里有优势。
高金额交易,医疗和法律决定,大规模消息发送,数据删除,这些都要保持谨慎。
这些任务可以让智能体准备材料,导航到最后一步,但不该因为技术上点得动就默认自动完成。
对软件公司来说,新的产品问题也出现了。
是继续优化给人用的界面,还是提供机器原生的入口,这个问题躲不开。
答案通常是两边都要。
高价值服务应该给出结构化、可授权的接口。
视觉界面留给人的理解和例外处理。
模型只在缺接口时临时使用,不该把它当成长期方案。
七、入口可能不再属于单个应用
AI 浏览器不会让应用消失,但会改变谁控制用户入口。
今天用户先打开某个软件,再在软件规定的流程里完成任务。
以后用户先向自己的智能体说出目标,由它决定调用哪些服务。
应用会失去一部分界面时间,也会拿到新的机器流量和交易机会。
这会推动软件从「让用户学会操作我」转向「让机器能够安全调用我」。
产品竞争的一部分,会从页面设计转到能力描述,转到数据质量,转到授权协议和结果可靠性。
它也不是老式自动化换一层皮。
它把自动化从预定义流程扩展到了动态目标,这是实质进步。
老办法留下的教训依然有效。
界面不是稳定接口。成功不能靠点击来判断。异常处理和维护成本,不会因为模型变聪明就消失。
未来最可靠的电脑操作智能体,大概不是那个最像人一样到处点鼠标的系统。
而是那个知道什么时候该用接口,什么时候该读页面结构,什么时候才退回视觉操作,并且在每个关键步骤都能证明事情确实做完了的系统。
对普通用户来说,这些底层变化最后都会落到手里的 AI工具 好不好用。
Gemini会员中转站 微信:douhanq
