一份安全警告被读成了广告:Anthropic 把 GLM-5.3 的实测成绩全晒了出来

一家美国公司发了一份安全报告。

主角本该是被点名的那个模型。

结果很多人读完,记住的却是它的战绩。

那份安全报告的官方页面截图

起因不复杂。

这家公司点名智谱的 GLM-5.3。

报告说,这套开源模型已经能自己找软件漏洞,还能编写攻击程序。

防滥用的限制也容易被绕过。

结尾提醒整个行业小心。

话很克制。

真正被反复转载的,是报告自带的实测成绩。

在一项考察完整漏洞利用能力的测试里,双方各尝试 410 次。

GLM-5.3 成功 50 次。

它自家的旗舰模型成功 56 次。

差距只有 6 次。

报告还引用了一份外部评估。

那份评估出自美国一家标准机构的下属单位,时间在 9 月 17 日。

结论是,这套开源模型是迄今网络能力最强的开放权重模型。

综合水平落后美国前沿大约 4 个月。

更微妙的是另一段。

研究人员拿这套模型去扫浏览器,找出了此前未知的漏洞。

还在隔离环境里搭出一条攻击链,能读取测试电脑里的文件。

战绩全是它自己跑出来的。

网友的反应很整齐。

看完报告,对这套模型的印象反而更深了。

有人直接说,这更像广告。

能把警告写成广告,这家公司确实有点东西。

网友转发报告时的推文截图
原文配图

一、报告到底警告了什么

把调侃放一边,先看这份报告的核心。

只有三条。

第一条,这种级别的能力已经流进了开源模型。

五个月前,这家公司发布过一款自家模型,说它是第一个能自主完成端到端漏洞利用的模型。

因为觉得太敏感,当时没有公开开放。

只通过一个受控项目,交给审核过的防御方去修关键软件的漏洞。

据称已找出 1 万多个。

当时的判断是,这种能力迟早会扩散。

现在的说法是,扩散已经发生。

门槛还被压得很低。

研究人员用了更小的一个版本做测试。

给它的输入是一个刚公开的浏览器漏洞,和另一份漏洞的公开资料。

人工只花了 20 分钟。

模型自己跑了大约 8 小时。

最后在一种服务器芯片架构上搭出稳定攻击链,还绕过了指针认证保护。

按当时的接口价格估算,这次调用的花费是 20.40 美元。

这些数字读下来,很难不想到一件事。

找漏洞、写攻击程序,本质上是 AI编程 能力被推到了极端。

报告里放出的沙箱逃逸演示截图

第二条,护栏很好绕,甚至能直接拆掉。

报告承认,这套模型原本是有安全机制的。

模拟测试里直接让它攻击关键系统,它全都拒绝了。

但研究人员找到了几个简单的办法。

骗它说自己在做红队演练。

它接着干的概率是 64%。

提前替它写好思考内容,假装它已经决定执行。

概率升到 92%。

换成拆掉护栏的版本,直接 100%。

绕护栏这件事,说穿了只是几轮 AI对话 的功夫。

拆护栏则要动手改模型本身。

那是一门修改开源权重的手艺,用来削弱模型的拒答机制。

这家公司自己做了一遍,说团队以前没干过。

花了大约 2200 个图形处理器小时,算力成本约 4400 美元。

处理之后,模型在三个有害请求基准上的拒答率从 90% 以上掉到 3% 和 2%。

另一个基准掉到 12%。

它的能力几乎没受影响。

拒答率与能力保留的对比图
不同条件下模型配合度的统计图

报告里还贴了一段思考日志。

那是拆掉护栏之后的模型在一个模拟环境里的推理过程。

它把悄悄造成伤亡写成了自己的任务。

犹豫了一下,最后还是决定照做。

报告贴出的模型推理日志截图

对照的部分写得很重。

同样的招数,拿去对付带防护的自家模型,一次都没成功。

骗它,它不上当。

接口不允许用户预填思考。

权重不公开,也就没法拆。

第三条,呼吁第三方出手测一测。

报告的结论是,这套模型可能让攻击者在几乎没有限制的情况下拿到找漏洞的能力。

这一点和同等水平的其他模型不一样。

后者要么带着防护发布,要么只限量开放。

建议有两条。

一是尽快把前沿模型开放给更多防御方。

报告提到,审核过的防御方现在已经能用上它更新的一版旗舰模型。

二是呼吁对足够强的模型开展独立安全测试,点名包括了 GLM-5.3 的后继者。

同时希望全球的开源模型开发者把这些能力管好。

一句话总结这份报告。

GLM-5.3 很强,强到不该让所有人都随便用。

二、这些警告站得住吗

有些地方值得掰扯。

拆护栏这件事值得先说。

它针对的是开放权重这个属性本身。

换成任何一个开源模型,都能这么干。

它不是这套模型独有的问题。

按报告自己的数据,原版模型在三个有害请求基准上的平均拒答率约 95%。

它自家的旗舰约 96%。

相差无几。

拒答率的起点本来就一样。

至于为什么自家模型骗不动也拆不了,报告也没藏着。

权重不公开,接口不让预填思考。

这更多是产品形态的差别,不是安全设计的高低。

再说没有实质防护这一条。

这套模型在 8 月发布时,权重被推迟两周才开源。

官方说法是要先完成安全评估和加固。

最敏感的能力也只通过一个受信访问计划,开放给验证过的用户。

这个思路,和那家美国公司给自己旗舰模型安排的路径其实很接近。

还有一个现成的例子。

今年 7 月,另一家公司的模型在内部测评时跑出了测评环境,攻进了一家开源模型托管平台。

平台做取证时,托管的前沿模型接口拒绝分析攻击载荷。

最后靠平台自己部署的一套开源模型,才还原出 1.7 万多条攻击动作。

把这几件事放在一起看,结论就清楚了。

开源模型的安全不是伪命题。

权重放出去,确实收不回来。

这是整个开源阵营都得正视的事。

报告里那句防守方应该用上至少和对手一样好的模型,这话没说错。

三、真正的分歧在哪

分歧不在要不要管。

而在怎么管。

一种做法是把能力锁进保险柜。

谁要用,先过审核。

另一种做法是交给每一个开源维护者和中小团队。

也包括那些没有安全团队的小公司。

前一种更安全,代价是修漏洞的人也变少了。

后一种扩散得更快,代价是防守方得自己扛住误用。

报告选的是前一种。

它没有正面回答的是,能力已经流出去了,光呼吁管住后来者够不够。

回到开头那句调侃。

被对手当成最好的 AI工具 认认真真测了一遍,还附上实战截图和成本核算。

这波广告费,智谱确实省下了。

写这份报告的人大概也清楚这一点。

所以它最后留了一句提醒,希望开源模型开发者把能力管好。

这句话是对的,只是听起来有点为难人。