网络安全研究者不满Anthropic Fable的安全护栏过于严格
Cybersecurity researchers aren’t happy about the guardrails on Anthropic’s Fable
网络安全研究人员抱怨Anthropic的新模型Fable的安全护栏过于严格,以至于无法进行任何网络安全相关工作,限制了其在安全领域的实用价值。
Anthropic 发布 Mythos 级模型 Claude Fable 后,网络安全研究人员很快发现其安全护栏(guardrails)过于严格,几乎无法用于任何网络安全工作。研究人员表示,Fable 拒绝执行常见的渗透测试命令、安全分析请求,甚至基本的网络安全查询。虽然 Anthropic 此前曾表示 Mythos 级模型在网络安全方面能力过强以至于不应公开发布,但目前的过度限制又走向了另一个极端,使安全专业人士无法利用这一强大的新工具。这种矛盾凸显了 AI 安全领域中能力释放与风险控制之间的平衡难题。
对 AI 行业的影响
Fable 的安全护栏问题反映了 AI 安全领域一个根本性的两难困境:过于严格的安全限制会扼杀模型的实用价值,而过于宽松又可能被恶意利用。对于网络安全这一特定领域,如何找到安全护栏的精确阈值,将直接影响 Mythos 级模型的实际应用前景。
原文参考
来源:TechCrunch AI · 2026-06-10
Cybersecurity researchers are complaining that Anthropic’s new model Fable has guardrails that are too strict for any cybersecurity work.