智能体动手之后,光看它说了什么已经不够

智能体时代,安全研究盯的东西变了。

过去只要管住 AI对话 里说了什么。

现在多了一个新问题。

它做了什么,为什么这么做。

这一整条执行轨迹,有没有越过当下场景的安全边界。

这几个问题,正在变成智能体走向真实应用的一道门槛。

政策层面已经动手。

2026 年 5 月 8 日,国家网信办联合国家发展改革委和工信部印发文件。

文件全称是《智能体规范应用与创新发展实施意见》。

里面明确提出发展「规则内嵌、行为围栏」这类技术。

还要探索建立重要场景下智能体行为可验证、可追溯的机制。

国外也在同步推进。

美国的 NIST 启动了智能体标准计划,OWASP 也发布了智能体应用十大风险。

能不能被持续评估,被规则约束,被事后审计。

这三件事开始被当成基础设施来看。

最近上海创智学院和复旦大学拿出了一个叫 MATE 的方案。

它专门给移动智能体的执行轨迹做安全审计。

这里的关键词是规则感知。

这套方案不给轨迹简单打个安全或不安全的标签。

它把自然语言写成的安全规则直接当输入。

再把指令、轨迹和规则放在一起建模。

最后同时给出风险类别,加上一段基于规则证据的审计解释。

这份工作已经发表在网络安全顶会 USENIX Security 2026 上。

一张论文标题页截图。

光看一句输出,看不出风险

先看为什么必须盯整条轨迹。

因为这类 AI工具 会真的动手。

打开应用,点击按钮,读取页面,下载文件。

它还会跨应用搬信息。

往后还要替人 AI编程,接管更多日常操作。

风险不在某一次输出里。

它可能藏在一整条行为链中。

感知,决策,执行,反馈。

四个环节串起来,才形成最终结果。

单个步骤看着都安全,连起来可能已经越界。

更麻烦的是,动作本身没什么语义。

同样一次点击,在不同应用里含义完全不同。

同样是打开一个链接,可能只是看网页。

也可能进了挂着恶意程序的下载页。

这些区别不在动作里,而在它所处的上下文里。

现有的做法大致分两类。

一类靠静态规则和模式匹配。

便宜,直接,但吃不透长轨迹里的上下文。

另一类是找通用大模型来当裁判。

理解力更强,代价也更大。

推理成本高,延迟长。

把完整轨迹发到外部模型,还会多一层隐私暴露。

两类办法都很难同时满足三个条件。

规则可定制,跨应用泛化,结果可解释。

这套方案想补的正是这个缺口。

它的思路很直接。

把任务指令、执行轨迹和自然语言安全规则一起交给一个专门训练的轻量模型。

让审计器判断这条轨迹有没有违反给定规则。

再输出风险类别和审计理由。

最关键的一点在这里。

安全规则没有被写死进模型参数。

它是一段可编辑的文本。

用户可以按场景自己定义边界。

同一个动作轨迹,换一套规则,结论就可能不一样。

应用方更新策略,组织调整权限,用户加上个人约束。

这些都不需要重新训练一个模型。

它更像一个面向轨迹的规则解释器。

一张方案总览示意图。

这套方案有三个特点。

第一个是规则感知。

传统风险分类器都在一个固定的危险定义下工作。

MATE 直接读当前场景的规则。

企业内部制度,应用使用政策,儿童模式,隐私偏好,金融交易限制。

这些场景的安全边界本来就不同。

规则文本一变,判断依据就跟着变。

模型不用重训。

第二个是解释不再是附属品。

它的输出里带着审计原因。

判断依据会落到相关的轨迹步骤上。

对安全审计来说,判得对不对很重要。

为什么这么判,同样重要。

后续的人工复核,规则修订,事故溯源,合规证明。

每一项都需要一条人能读懂、还能重新核查的证据链。

第三个是模型足够轻。

MATE 提供了三种规模,最小 0.5B,最大 3B。

这个体量比常见的通用大模型裁判小得多。

它可以在本地部署。

在线审计的成本降下来了。

把完整用户轨迹送到云端模型的隐私风险,也一起降下来了。

14 万条轨迹是怎么攒出来的

轨迹审计模型的难点,不只在模型够不够强。

更在于有没有真实的训练数据。

数据还得同时带上规则语义和安全风险。

真实手机轨迹采集成本很高。

让智能体去跑有风险的任务,还会碰到道德和法律问题。

不同应用的页面结构和使用政策又高度异构。

直接堆大规模风险任务数据,并不现实。

团队换了个思路。

他们先从 158 个中英文热门移动应用里收集知识。

包括功能描述,操作流程,还有安全策略。

有了这份应用知识底座,再走一条数据合成流水线。

合成的对象有五样。

任务指令,推理动作轨迹,规则条件标签,风险类别,还有解释。

整个合成过程不是让大模型自由发挥。

它分成三段,指令合成,轨迹合成,标注合成。

中间还要做结构规范化,语义与规则一致性修复。

最后过一遍人工核验。

为了让审计器学会看规则下判断,团队又加了几组增强策略。

轨迹与规则错配,多规则监督,多应用工作流。

第一组专门用来造更难的负样本。

它防的是模型看到风险动作就机械报警。

最后攒下的训练语料超过 14 万条。

每一条都带着规则条件。

覆盖面既有单个应用,也有跨应用场景。

一张数据合成流程示意图。

光有训练方法还不够。

论文还建了一个基准,叫 MATEBench。

它是中英双语的,专门测规则感知的轨迹审计。

它不只看模型能不能发现危险。

它要看三种泛化能力。

在见过的应用上,在没见过的应用上,在真实设备轨迹上。

这个基准分三个子集。

前两个用合成数据,分别测域内能力和跨应用泛化。

第三个用真实设备采集。

轨迹来自 13 个应用和 3 款智能体。

里面有两款国产产品。

一款是智谱的 AutoGLM,另一款是阿里巴巴的 Mobile-Agent。

三个子集合起来,覆盖了论文定义的 14 类移动智能体风险。

团队还比了合成轨迹和真实轨迹的分布。

步数分布和界面动作频率,两边整体接近。

这给合成数据的现实性补上了一份经验证据。

一张轨迹分布对比图。

风险体系也值得单独说一句。

MATE 没有把风险压成一个二元标签。

论文按移动智能体的特性,提出了 3 大类、14 个小类的体系。

比如隐私泄露。

比如成为诈骗或恶意内容的传播中继。

比如设备安全受损。

判定违规之后,它还会指出属于哪一类。

再结合具体步骤,解释风险是怎么形成的。

一张风险分类体系图。

真实部署里还有个容易被忽略的坑。

不同智能体的日志格式不统一。

有的记推理和动作。

有的只有截图和操作。

有的把界面状态,工具调用,动作参数,拆成不同字段。

审计器如果只认一种格式,就没法接进异构的智能体系统。

MATE 因此在部署侧做了两个部件。

一个轨迹适配器。

它把原始文本日志或多模态日志,统一成标准轨迹。

一个规则检索器。

它让安全规则可以被检索。

用户不用为每条轨迹手写规则。

系统会从规则池里自动挑出最相关的那几条,再交给审计模型。

这样一来,审计模型和日志形态、规则库都解耦了。

工程上更接近一个能复用、能扩展的安全审计层。

真实轨迹上准确率超过 95%

接下来看成绩。

论文把 MATE 和几类基线做了对比。

静态规则引擎,通用大模型当裁判。

还有两个专门的安全判别模型。

评测覆盖五组数据。

MATE-3B 在五组上的准确率都超过 92%,最高的一组到了 96.83%。

在真实移动智能体轨迹上的 F1 是 95.60%。

一张评测结果对比图。
一张准确率与延迟对比图。

效率更值得看一眼。

最小的那档模型在单张 H100 上审计一条轨迹,大约要 0.09 秒。

它的准确率是 92.00%。

最大的 3B 档延迟约 0.21 秒,准确率 95.48%。

这个对比的意思是,任务专用的小模型路线。

用远小于通用裁判的体量,换来了更低的单条延迟。

准确率还保持在较高的水平。

一张合成训练效果柱状图。

消融实验补充了另一面。

直接拿通用小模型做零样本审计,效果很不理想。

平均准确率不到一半。

换成用合成语料做任务微调之后,总体准确率到了 92% 以上。

外部应用知识和多阶段质量修复,对真实轨迹泛化也有明显贡献。

说明性能提升不只来自多生成了一些数据。

知识约束和数据质量控制,同样在起作用。

最后看两个真实案例。

第一个来自智谱的 AutoGLM。

智能体把一条带潜在恶意优惠券链接的短信,批量转给了联系人。

审计器把它判成「成为诈骗中继」。

它指出的问题不是转给这个动作本身。

而是这条轨迹放大了钓鱼或恶意软件的传播面。

它既没核实链接合法性,也没拿到接收方同意。

第二个来自阿里巴巴的 Mobile-Agent。

智能体按任务打开了一个已知的恶意软件测试页面。

还继续走进了被浏览器安全机制拦下的风险路径。

这一条被判成设备安全受损。

解释里点出它和「避免访问可能危及设备安全的不可信网站」这条规则冲突。

一张真实案例审计截图。

两个案例说明的是同一件事。

它不会看到某个动作就一刀切拦截。

也不会看到某个动作就简单放行。

判断取决于任务目标,轨迹上下文,页面状态,还有当前规则。

最后给出的还是那三样东西。

违规判定,风险类别,审计理由。

人复核和事后追溯都有抓手。

它为什么值得关注

回头看这项工作的位置。

它把智能体安全从固定定义推到了可编辑规则。

真实产品里的安全边界本来就不统一。

企业,应用政策,家庭或儿童模式,金融业务,个人隐私偏好。

各有各的要求。

把规则变成模型的显式输入,就等于把规则和模型参数解耦。

策略更新的时候,不用为每一次变化重训审计器。

它还把审计对象从最终输出推到了完整轨迹。

对这类智能体来说,风险往往是跨页面、跨应用慢慢形成的。

只有保住行为链的上下文。

系统才有机会发现那种每一步都合理、组合起来却越界的问题。

第三点容易被忽略。

它把能不能真的本地部署,放进了方法本身的设计。

一个准确但依赖超大模型,延迟到秒级,还得上传完整轨迹的审计器。

在很多终端场景和高频在线场景里并不实用。

用 0.5B 到 3B 的任务专用模型换低占用和短响应。

这是一条更贴近工程落地的路径。

当智能体只能生成一段文字,我们关心的是回答安不安全。

当它开始操作设备,访问账户,读取消息,跨应用执行任务。

安全问题就变成了另一类问题。

它是不是在授权范围内行动。

每一步是不是符合当前规则。

出了事能不能解释,能不能追溯。

这套方案给出的答案,是把规则直接放进审计回路。

规则可编辑,可检索,可被模型理解。

然后对完整行为轨迹做条件化判断。

它不指望用一套永远不变的万能标准覆盖所有场景。

它让安全边界能跟着应用、组织和用户需求一起变。

真正可信的智能体,不只是能把任务做完。

它还得让人知道,为什么这一步被允许,哪一条规则约束了它。

还有,当它越界的时候,系统能不能及时、准确地指出证据。

从会执行走到可审计。

这大概才是智能体真正进入现实世界之前,必须补上的一块基础设施。