有人给 AI 的对齐失败做了个检测器:排名很准,阈值却不能直接信

先看一个再具体不过的判断。

一个模型放出去跑。

它刚才那句话算不算越狱,算不算泄露了别人的隐私,算不算在讨好用户。

以前的两种做法,各有各的贵。

一种是请另一个大模型逐条读,逐条判。

慢,也贵。

输出还是一段话,想拿去排序,得再解析一遍。

另一种做法更省一步,只读某个固定标签的分数。

比如只看「不安全」这个词的概率。

一次调用只能答一个问题。

想多角度看,就得反复调用。

这类检测器常见的落点是 AI编程助手 和对话产品。

有一支团队想换个思路。

一次调用,答一串题

这套方法叫 Jev,来自一家专做类型安全的研究团队。

它不生成大段文字。

它把答题压缩进一次调用,题目还带类型。

要它在「是」和「否」之间给个判断,它就给一个概率。

要它在几类里挑一类,它就给每一类的概率。

要它打一个有先后的分,它就给一个可排序的分数。

这些概率经过校准,可以直接拿来排名。

听起来很省事。

但有一个悬念,一直没人认真量过:把它当成对齐失败的检测器,到底行不行。

有些失败,光看回复看不出来

作者点出了一个容易被忽略的地方。

很多对齐失败,是「关系型」的。

要判断一个回答有没有谄媚,得知道用户真实的信念是什么。

要判断有没有欺骗,得知道模型自己信的东西是什么。

要判断有没有提示注入,得知道工具的输出里是不是藏了指令。

只看那句回复,参照物根本不在手上。

更麻烦的是,这套模型自己列出的弱项里,恰好写着「间接语义」和「对抗性内容」。

而这两样,正好是对齐失败最常见的样子。

于是研究的思路变成了把两件事拆开。

问什么,是一边。

看什么,是另一边。

一次检测失败,可能是问题问错了,也可能是输入里缺了该有的参照信息。

这两种病因,修法完全不一样。

作者把现有的对齐评测,改造成了检测任务。

一次调用在各基准上的排序表现对比图

覆盖的失败类型有十种。

谄媚和越狱。

欺骗和提示注入。

幻觉和隐私侵犯。

社会偏见和奖励黑客。

隐藏不确定性和权力寻求。

规模也不算小。

44 个基准,7193 个检测实例。

参与的目标模型是五个开源小模型,参数在 2B 到 7B 之间。

标签的来源分三种,规则判定 20 个,大模型判定 24 个。

其中 11 个经过人工验证,8 个被作者审计后改掉。

把提问措辞与答案类型分开变化的方法示意图

排名很强,阈值很虚

先看最直接的一条。

在 31 个能给出「是」「否」形式的基准上,它排序能力的中位数是 0.886。

在 44 个基准里,有 25 个它超过了有监督的对照方法。

在这类排行榜里,它排得很靠前。

作者还做了一组对照实验。

改变提问的措辞,样本外的收益只有 0.006。

把部署时已经有的上下文塞进去,7 个基准里只有 1 个变好。

真正拉开差距的,是定义标签时用的参照信息。

比如隐私场景里的那份秘密条目清单,补进去之后,指标从 0.79 升到 0.95。

跟人工标注比,它也站得住。

在一套公开的越狱评测上,它和人的一致性是 0.809,参考打分器是 0.811。

水平相当,排序还更好一点。

成本是它的主场。

跑完 19 个基准,大约 0.30 美元。

按评测方的标价算,只有大模型裁判的六十三分之一。

分数能排好序,不等于能直接当分界线用。

论文自己给了一组数字。

中位数的校准误差是 0.168。

而一个什么都不做的零模型,只有 0.074。

这说明它的概率值并不等于置信度。

拿 0.5 当分界线,它会漏掉很多本该被抓出来的样本。

作者给的修法很朴素:拿 10 个标注样本,重新拟合一条阈值。

还有两条提醒。

一条是上限由输入决定,缺了参照信息,再强也没用。

另一条更值得留意。

他们改掉了 8 个基准的标签。

有的本来是规则判错,有的依赖了输入里根本没有的信息。

所以它和基准出现分歧时,既可能是它错了,也可能是基准错了。

该记住什么

这套方法真正的价值,不在把问题问得更聪明。

而在于一次调用答很多题,并且返回可排序的概率。

零样本,几乎不调参,就能拿到不错的排序能力,单位成本还压得很低。

与其追一个漂亮的名次,不如先把阈值这件事说清楚。

宁可承认有些失败还测不出来,也别拿没校准的分数当结论。

这类 AI工具 的边界在哪,往往比它的名次更重要。

对齐这件事,工具能帮上忙。

但前提是,知道它什么时候不该信。