### [AI护栏拦住的不是黑客,是白帽子:安全研究员正被逼向开源模型](https://www.willai.cc/article/4353) **Published:** 2026-07-26T10:02:16 **Author:** hiyoho **Excerpt:** 过去几个月,AI大厂为了防止黑客滥用模型,设计了一整套审核准入和安全护栏。出发点没毛病,但现在一批合法的安全研究员发现,自己的正经工作先被拦住了——那些以找漏洞、写利用代码为业的白帽子,正在被自家阵营的AI拒之门外。 Anthropic 的 过去几个月,AI大厂为了防止黑客滥用模型,设计了一整套审核准入和安全护栏。出发点没毛病,但现在一批合法的安全研究员发现,自己的正经工作先被拦住了——那些以找漏洞、写利用代码为业的白帽子,正在被自家阵营的AI拒之门外。 ![Anthropic Mythos 模型与AI安全护栏](https://techcrunch.com/wp-content/uploads/2026/06/claude-mythos-logo.jpg?resize=1200,800) Anthropic 的 Mythos 曾被出口管制,护栏争议由此升温(图源:TechCrunch) ### 同一把锤子,既盖房也伤人 事情的背景要从6月说起。美国政府当时对Anthropic的Mythos和Fable两款模型下了出口管制,起因之一是有报告称其防攻击护栏可以被绕过。管制后来解除了,Fable 5在7月1日恢复开放,Mythos 5则只向通过审查的美国机构重新开放。眼下OpenAI有Trusted Access for Cyber计划,Anthropic有Cyber Verification Program,安全研究员要先申请、被审核,通过了才能用上限制更少的模型。 知名安全研究员Mark Dowd在播客里说得很直接:几家大公司凭什么替整个行业裁定”什么安全研究是安全的”。NCC Group首席科学家Chris Anley则点出了问题的死结——让AI尝试利用一个bug,是确认漏洞真实存在的关键步骤,而护栏一旦让模型直接拒答,受伤的是防御方。 > “修复这段代码”这个提示词,既是防御的基本手段,也是找出致命漏洞的路线图。同一个工具,攻防一体,根本拆不开——就像锤子,你没法用一把不能敲东西的锤子盖房子。 ### 被护栏劝退的人,去了哪里 漏洞交易公司Crowdfense的CTO Paolo Stagno吐槽,AI公司”把客户当成需要保姆看着的小孩”。他们团队只拿前沿模型做逆向工程,找漏洞、写利用一律不碰云端模型——不是怕拒答,而是怕高价值的漏洞数据被喂进下一轮训练。这类活儿他们全部用本地部署的开源模型来干。 一位不愿具名的手机零部件厂商研究员说,公司没进Anthropic的审核名单,结果模型”一旦嗅到我们在干安全相关的事就直接罢工,基本没法用”。RemoteThreat的CEO Chris Thompson补充了另一个痛点:护栏的尺度每天都在变,即便在审核通过的项目里也一样,”大量时间花在跟模型讨价还价上,而不是分析漏洞本身”。 - 研究员的普遍退路:转向可本地运行、无使用限制的开源模型,敏感数据不出本机; - 也有例外:研究员Giuseppe Cali只用AI做逆向和辅助工具,”挖洞这件事我要亲自来,护栏全拆了我也不变”; - Thompson的判断:护栏没拦住真正的攻击者,反而把守规矩的研究员从受监管的体系里推了出去。 * * * Thompson给AI实验室的建议是反着来:把准入计划开得更大,给负责任的研究员正常访问权,谁滥用就追责谁,而不是一刀切收紧。他的理由带着紧迫感——一场速度和规模前所未有的攻击浪潮正在路上,而此刻被捂住手脚的,恰恰是想赶在犯罪分子前面把漏洞补上的那批人。 📎 原文来源:[How AI guardrails are impeding the work of offensive cybersecurity researchers – TechCrunch](https://techcrunch.com/2026/07/23/how-ai-guardrails-are-impeding-the-work-of-offensive-cybersecurity-researchers/) **Tags:** AI, AI安全, AI安全护栏, AI技术, Anthropic, 网络安全 **Categories:** AI资讯 **Comments:** **PRFKY42165:** 最讽刺的是结果:真正的攻击者本来就不缺办法,护栏筛掉的全是守规矩走审核流程的白帽子,最后把他们推向了完全没有监管的本地开源模型。这算安全治理还是自废武功? **MWTAH51627:** 锤子那个比喻说到点子上了,fix this code既是修复指南也是攻击路线图,本来就是一体两面。指望在提示词层面把攻防拆开,方向可能从一开始就错了。 ---