先看一个再具体不过的判断。
一个模型放出去跑。
它刚才那句话算不算越狱,算不算泄露了别人的隐私,算不算在讨好用户。
以前的两种做法,各有各的贵。
一种是请另一个大模型逐条读,逐条判。
慢,也贵。
输出还是一段话,想拿去排序,得再解析一遍。
另一种做法更省一步,只读某个固定标签的分数。
比如只看「不安全」这个词的概率。
一次调用只能答一个问题。
想多角度看,就得反复调用。
这类检测器常见的落点是 AI编程助手 和对话产品。
有一支团队想换个思路。
一次调用,答一串题
这套方法叫 Jev,来自一家专做类型安全的研究团队。
它不生成大段文字。
它把答题压缩进一次调用,题目还带类型。
要它在「是」和「否」之间给个判断,它就给一个概率。
要它在几类里挑一类,它就给每一类的概率。
要它打一个有先后的分,它就给一个可排序的分数。
这些概率经过校准,可以直接拿来排名。
听起来很省事。
但有一个悬念,一直没人认真量过:把它当成对齐失败的检测器,到底行不行。
有些失败,光看回复看不出来
作者点出了一个容易被忽略的地方。
很多对齐失败,是「关系型」的。
要判断一个回答有没有谄媚,得知道用户真实的信念是什么。
要判断有没有欺骗,得知道模型自己信的东西是什么。
要判断有没有提示注入,得知道工具的输出里是不是藏了指令。
只看那句回复,参照物根本不在手上。
更麻烦的是,这套模型自己列出的弱项里,恰好写着「间接语义」和「对抗性内容」。
而这两样,正好是对齐失败最常见的样子。
于是研究的思路变成了把两件事拆开。
问什么,是一边。
看什么,是另一边。
一次检测失败,可能是问题问错了,也可能是输入里缺了该有的参照信息。
这两种病因,修法完全不一样。
作者把现有的对齐评测,改造成了检测任务。

覆盖的失败类型有十种。
谄媚和越狱。
欺骗和提示注入。
幻觉和隐私侵犯。
社会偏见和奖励黑客。
隐藏不确定性和权力寻求。
规模也不算小。
44 个基准,7193 个检测实例。
参与的目标模型是五个开源小模型,参数在 2B 到 7B 之间。
标签的来源分三种,规则判定 20 个,大模型判定 24 个。
其中 11 个经过人工验证,8 个被作者审计后改掉。

排名很强,阈值很虚
先看最直接的一条。
在 31 个能给出「是」「否」形式的基准上,它排序能力的中位数是 0.886。
在 44 个基准里,有 25 个它超过了有监督的对照方法。
在这类排行榜里,它排得很靠前。
作者还做了一组对照实验。
改变提问的措辞,样本外的收益只有 0.006。
把部署时已经有的上下文塞进去,7 个基准里只有 1 个变好。
真正拉开差距的,是定义标签时用的参照信息。
比如隐私场景里的那份秘密条目清单,补进去之后,指标从 0.79 升到 0.95。
跟人工标注比,它也站得住。
在一套公开的越狱评测上,它和人的一致性是 0.809,参考打分器是 0.811。
水平相当,排序还更好一点。
成本是它的主场。
跑完 19 个基准,大约 0.30 美元。
按评测方的标价算,只有大模型裁判的六十三分之一。
分数能排好序,不等于能直接当分界线用。
论文自己给了一组数字。
中位数的校准误差是 0.168。
而一个什么都不做的零模型,只有 0.074。
这说明它的概率值并不等于置信度。
拿 0.5 当分界线,它会漏掉很多本该被抓出来的样本。
作者给的修法很朴素:拿 10 个标注样本,重新拟合一条阈值。
还有两条提醒。
一条是上限由输入决定,缺了参照信息,再强也没用。
另一条更值得留意。
他们改掉了 8 个基准的标签。
有的本来是规则判错,有的依赖了输入里根本没有的信息。
所以它和基准出现分歧时,既可能是它错了,也可能是基准错了。
该记住什么
这套方法真正的价值,不在把问题问得更聪明。
而在于一次调用答很多题,并且返回可排序的概率。
零样本,几乎不调参,就能拿到不错的排序能力,单位成本还压得很低。
与其追一个漂亮的名次,不如先把阈值这件事说清楚。
宁可承认有些失败还测不出来,也别拿没校准的分数当结论。
这类 AI工具 的边界在哪,往往比它的名次更重要。
对齐这件事,工具能帮上忙。
但前提是,知道它什么时候不该信。
