### [AI大厂给模型装的安全锁,正把’好人’研究员逼向中国开源模型](https://www.willai.cc/article/4259) **Published:** 2026-07-24T05:52:01 **Author:** hiyoho **Excerpt:** 这两年AI大厂拼命给自家模型上锁,生怕被黑客拿去搞破坏。可锁装得太死,最先被卡住的反而是那群本该被保护的人——正儿八经找漏洞、修系统的网络安全研究员。他们现在越来越头疼,甚至开始转投中国的开源模型。 Anthropic曾把Mythos包装成 这两年AI大厂拼命给自家模型上锁,生怕被黑客拿去搞破坏。可锁装得太死,最先被卡住的反而是那群本该被保护的人——正儿八经找漏洞、修系统的网络安全研究员。他们现在越来越头疼,甚至开始转投中国的开源模型。 ![Anthropic的Mythos与Fable模型](https://techcrunch.com/wp-content/uploads/2026/06/claude-mythos-logo.jpg?resize=1200,800) Anthropic曾把Mythos包装成只能给”通过审核用户”的末日级模型 ### 一把工具,既能盖房也能砸人 今年6月,美国政府对Anthropic两款被吹得神乎其神的模型Mythos和Fable下了出口管制。导火索之一,是有报告称能绕过模型防护、拿它来造网络攻击。后来管制解除了——Fable 5在7月1日恢复公开访问,Mythos 5只对通过审核的美国机构重新开放。但这场风波把一个矛盾摆上了台面。 NCC Group首席科学家Chris Anley说得很直白:让AI去尝试利用一个漏洞,是确认它”真的是漏洞、值得修”的关键一步。可一旦护栏直接让模型拒答,防守方就抓瞎了。 > “这就像一把锤子。没有锤子你盖不了房子,它是工具,但它也无可避免地是件武器。攻击工具和防御工具其实是同一样东西,根本掰不开。” ### “把客户当小孩看管” 干了几十年、专门找零日漏洞卖给西方政府的资深研究员Mark Dowd吐槽,让一堆大公司随意决定”安全领域什么能做什么不能做”,让他很不舒服。漏洞交易公司Crowdfense的CTO Paolo Stagno话更冲,说AI公司搞审核和护栏这套,”本质上是把客户当成需要保姆看着的小孩”。 不过也有人觉得没那么夸张。研究员Giuseppe Cali就说护栏没挡他的路,因为他压根不用AI做攻击那部分——只拿来做初步逆向、理解代码、搭辅助工具。用他的话说,他”舍不得把自己的漏洞交给模型去玩”,这游戏他自己玩得太上头。 * * * ### 护栏时好时坏,逼人转向中国模型 RemoteThreat的CEO、Offensive AI Con创办人Chris Thompson的抱怨更具体:前沿模型的护栏时松时紧,每天表现都不一样,哪怕是在Anthropic和OpenAI那些”审核过的项目”里也是如此。结果研究员大把时间花在跟模型”讨价还价”上,而不是真正分析漏洞。 - 一名智能手机零件厂商的研究员说,公司没进Anthropic的审核项目,模型”一嗅到跟安全沾边就停下来,根本没法用”; - 碰壁之后,不少人干脆退回到完全没护栏的开源模型; - Thompson直言,很多人被推向了像GLM这类中国开源模型——免费下载、本地运行、没有任何审核和使用限制。 这就有点讽刺了。”你把这些负责任的研究员,从美国管辖的系统赶到了外国拥有的系统上,”Thompson说,”我觉得这些护栏弊大于利。”他呼吁前沿实验室别再一味收紧,而是把项目开放、给出负责任的访问权限,再去追究真正滥用工具的人。否则真等那波”前所未有、又快又大规模”的攻击浪潮来了,防守的一方反而先被自己人的锁困住。 📎 原文来源:[How AI guardrails are impeding the work of offensive cybersecurity researchers (TechCrunch)](https://techcrunch.com/2026/07/23/how-ai-guardrails-are-impeding-the-work-of-offensive-cybersecurity-researchers/) **Tags:** AI, AI安全护栏, AI开源, AI技术, Anthropic, 网络安全 **Categories:** AI资讯 **Comments:** **PRFKY42165:** 看到研究员被推去用GLM那段有点感慨,管制的初衷是把风险关在门里,结果门关太死,人从窗户跳出去了。与其收紧不如像文里说的开放审核+追责滥用,光靠拒答护栏挡不住真想干坏事的。 **MWTAH51627:** 护栏这事儿真是两难,模型分不清你是想修漏洞还是想造武器,一刀切就误伤了正经研究员。但反过来说,真放开了滥用的人也拦不住。最后逼得大家用本地开源模型,安全数据反而更不好管了,感觉这题无解。 ---