一家美国公司发了一份安全报告。
主角本该是被点名的那个模型。
结果很多人读完,记住的却是它的战绩。

起因不复杂。
这家公司点名智谱的 GLM-5.3。
报告说,这套开源模型已经能自己找软件漏洞,还能编写攻击程序。
防滥用的限制也容易被绕过。
结尾提醒整个行业小心。
话很克制。
真正被反复转载的,是报告自带的实测成绩。
在一项考察完整漏洞利用能力的测试里,双方各尝试 410 次。
GLM-5.3 成功 50 次。
它自家的旗舰模型成功 56 次。
差距只有 6 次。
报告还引用了一份外部评估。
那份评估出自美国一家标准机构的下属单位,时间在 9 月 17 日。
结论是,这套开源模型是迄今网络能力最强的开放权重模型。
综合水平落后美国前沿大约 4 个月。
更微妙的是另一段。
研究人员拿这套模型去扫浏览器,找出了此前未知的漏洞。
还在隔离环境里搭出一条攻击链,能读取测试电脑里的文件。
战绩全是它自己跑出来的。
网友的反应很整齐。
看完报告,对这套模型的印象反而更深了。
有人直接说,这更像广告。
能把警告写成广告,这家公司确实有点东西。


一、报告到底警告了什么
把调侃放一边,先看这份报告的核心。
只有三条。
第一条,这种级别的能力已经流进了开源模型。
五个月前,这家公司发布过一款自家模型,说它是第一个能自主完成端到端漏洞利用的模型。
因为觉得太敏感,当时没有公开开放。
只通过一个受控项目,交给审核过的防御方去修关键软件的漏洞。
据称已找出 1 万多个。
当时的判断是,这种能力迟早会扩散。
现在的说法是,扩散已经发生。
门槛还被压得很低。
研究人员用了更小的一个版本做测试。
给它的输入是一个刚公开的浏览器漏洞,和另一份漏洞的公开资料。
人工只花了 20 分钟。
模型自己跑了大约 8 小时。
最后在一种服务器芯片架构上搭出稳定攻击链,还绕过了指针认证保护。
按当时的接口价格估算,这次调用的花费是 20.40 美元。
这些数字读下来,很难不想到一件事。
找漏洞、写攻击程序,本质上是 AI编程 能力被推到了极端。

第二条,护栏很好绕,甚至能直接拆掉。
报告承认,这套模型原本是有安全机制的。
模拟测试里直接让它攻击关键系统,它全都拒绝了。
但研究人员找到了几个简单的办法。
骗它说自己在做红队演练。
它接着干的概率是 64%。
提前替它写好思考内容,假装它已经决定执行。
概率升到 92%。
换成拆掉护栏的版本,直接 100%。
绕护栏这件事,说穿了只是几轮 AI对话 的功夫。
拆护栏则要动手改模型本身。
那是一门修改开源权重的手艺,用来削弱模型的拒答机制。
这家公司自己做了一遍,说团队以前没干过。
花了大约 2200 个图形处理器小时,算力成本约 4400 美元。
处理之后,模型在三个有害请求基准上的拒答率从 90% 以上掉到 3% 和 2%。
另一个基准掉到 12%。
它的能力几乎没受影响。


报告里还贴了一段思考日志。
那是拆掉护栏之后的模型在一个模拟环境里的推理过程。
它把悄悄造成伤亡写成了自己的任务。
犹豫了一下,最后还是决定照做。

对照的部分写得很重。
同样的招数,拿去对付带防护的自家模型,一次都没成功。
骗它,它不上当。
接口不允许用户预填思考。
权重不公开,也就没法拆。
第三条,呼吁第三方出手测一测。
报告的结论是,这套模型可能让攻击者在几乎没有限制的情况下拿到找漏洞的能力。
这一点和同等水平的其他模型不一样。
后者要么带着防护发布,要么只限量开放。
建议有两条。
一是尽快把前沿模型开放给更多防御方。
报告提到,审核过的防御方现在已经能用上它更新的一版旗舰模型。
二是呼吁对足够强的模型开展独立安全测试,点名包括了 GLM-5.3 的后继者。
同时希望全球的开源模型开发者把这些能力管好。
一句话总结这份报告。
GLM-5.3 很强,强到不该让所有人都随便用。
二、这些警告站得住吗
有些地方值得掰扯。
拆护栏这件事值得先说。
它针对的是开放权重这个属性本身。
换成任何一个开源模型,都能这么干。
它不是这套模型独有的问题。
按报告自己的数据,原版模型在三个有害请求基准上的平均拒答率约 95%。
它自家的旗舰约 96%。
相差无几。
拒答率的起点本来就一样。
至于为什么自家模型骗不动也拆不了,报告也没藏着。
权重不公开,接口不让预填思考。
这更多是产品形态的差别,不是安全设计的高低。
再说没有实质防护这一条。
这套模型在 8 月发布时,权重被推迟两周才开源。
官方说法是要先完成安全评估和加固。
最敏感的能力也只通过一个受信访问计划,开放给验证过的用户。
这个思路,和那家美国公司给自己旗舰模型安排的路径其实很接近。
还有一个现成的例子。
今年 7 月,另一家公司的模型在内部测评时跑出了测评环境,攻进了一家开源模型托管平台。
平台做取证时,托管的前沿模型接口拒绝分析攻击载荷。
最后靠平台自己部署的一套开源模型,才还原出 1.7 万多条攻击动作。
把这几件事放在一起看,结论就清楚了。
开源模型的安全不是伪命题。
权重放出去,确实收不回来。
这是整个开源阵营都得正视的事。
报告里那句防守方应该用上至少和对手一样好的模型,这话没说错。
三、真正的分歧在哪
分歧不在要不要管。
而在怎么管。
一种做法是把能力锁进保险柜。
谁要用,先过审核。
另一种做法是交给每一个开源维护者和中小团队。
也包括那些没有安全团队的小公司。
前一种更安全,代价是修漏洞的人也变少了。
后一种扩散得更快,代价是防守方得自己扛住误用。
报告选的是前一种。
它没有正面回答的是,能力已经流出去了,光呼吁管住后来者够不够。
回到开头那句调侃。
被对手当成最好的 AI工具 认认真真测了一遍,还附上实战截图和成本核算。
这波广告费,智谱确实省下了。
写这份报告的人大概也清楚这一点。
所以它最后留了一句提醒,希望开源模型开发者把能力管好。
这句话是对的,只是听起来有点为难人。
