这两年AI大厂拼命给自家模型上锁,生怕被黑客拿去搞破坏。可锁装得太死,最先被卡住的反而是那群本该被保护的人——正儿八经找漏洞、修系统的网络安全研究员。他们现在越来越头疼,甚至开始转投中国的开源模型。

一把工具,既能盖房也能砸人
今年6月,美国政府对Anthropic两款被吹得神乎其神的模型Mythos和Fable下了出口管制。导火索之一,是有报告称能绕过模型防护、拿它来造网络攻击。后来管制解除了——Fable 5在7月1日恢复公开访问,Mythos 5只对通过审核的美国机构重新开放。但这场风波把一个矛盾摆上了台面。
NCC Group首席科学家Chris Anley说得很直白:让AI去尝试利用一个漏洞,是确认它”真的是漏洞、值得修”的关键一步。可一旦护栏直接让模型拒答,防守方就抓瞎了。
“这就像一把锤子。没有锤子你盖不了房子,它是工具,但它也无可避免地是件武器。攻击工具和防御工具其实是同一样东西,根本掰不开。”
“把客户当小孩看管”
干了几十年、专门找零日漏洞卖给西方政府的资深研究员Mark Dowd吐槽,让一堆大公司随意决定”安全领域什么能做什么不能做”,让他很不舒服。漏洞交易公司Crowdfense的CTO Paolo Stagno话更冲,说AI公司搞审核和护栏这套,”本质上是把客户当成需要保姆看着的小孩”。
不过也有人觉得没那么夸张。研究员Giuseppe Cali就说护栏没挡他的路,因为他压根不用AI做攻击那部分——只拿来做初步逆向、理解代码、搭辅助工具。用他的话说,他”舍不得把自己的漏洞交给模型去玩”,这游戏他自己玩得太上头。
护栏时好时坏,逼人转向中国模型
RemoteThreat的CEO、Offensive AI Con创办人Chris Thompson的抱怨更具体:前沿模型的护栏时松时紧,每天表现都不一样,哪怕是在Anthropic和OpenAI那些”审核过的项目”里也是如此。结果研究员大把时间花在跟模型”讨价还价”上,而不是真正分析漏洞。
- 一名智能手机零件厂商的研究员说,公司没进Anthropic的审核项目,模型”一嗅到跟安全沾边就停下来,根本没法用”;
- 碰壁之后,不少人干脆退回到完全没护栏的开源模型;
- Thompson直言,很多人被推向了像GLM这类中国开源模型——免费下载、本地运行、没有任何审核和使用限制。
这就有点讽刺了。”你把这些负责任的研究员,从美国管辖的系统赶到了外国拥有的系统上,”Thompson说,”我觉得这些护栏弊大于利。”他呼吁前沿实验室别再一味收紧,而是把项目开放、给出负责任的访问权限,再去追究真正滥用工具的人。否则真等那波”前所未有、又快又大规模”的攻击浪潮来了,防守的一方反而先被自己人的锁困住。

看到研究员被推去用GLM那段有点感慨,管制的初衷是把风险关在门里,结果门关太死,人从窗户跳出去了。与其收紧不如像文里说的开放审核+追责滥用,光靠拒答护栏挡不住真想干坏事的。
护栏这事儿真是两难,模型分不清你是想修漏洞还是想造武器,一刀切就误伤了正经研究员。但反过来说,真放开了滥用的人也拦不住。最后逼得大家用本地开源模型,安全数据反而更不好管了,感觉这题无解。