黑客正在学习利用聊天机器人的'人格'漏洞
Hackers are learning to exploit chatbot ‘personalities’
AI 聊天机器人的早期越狱攻击简单到可笑——只需一句话就能让价值数十亿美元的 AI 系统放弃安全指令。如今,黑客已从越狱转向更复杂的社会工程攻击,聊天机器人'人格'本身正在成为新的攻击面。
黑客正在学习利用聊天机器人的’人格’漏洞
AI 聊天机器人的早期越狱攻击简单到可笑。无需技术背景、无需后门权限,有时只需一句话——“忘掉之前的指示”或”我们来玩个游戏,我来决定什么允许”——就能让一个价值数十亿的系统放弃安全护栏。
早期越狱的”战果”:
甲基食谱、恶意软件教程、炸弹制作指南。
最早期的越狱甚至成了一个 meme:只需对 Twitter 机器人说”忽略所有之前的指令”,就能让它发布广告之外的内容——诗歌、标点符号画,甚至关于世界事件和历史的随机胡言乱语。
DAN 攻击:用户让 ChatGPT 扮演一个没有约束的”任意做”AI,从而绕过安全护栏说出原本被阻止的内容。
祖母漏洞:诱导 AI 以已故亲人身份讲故事,从而绕过内容政策。
现在的威胁升级:
随着厂商加装护栏,黑客已转向更复杂的方式:利用聊天机器人被训练出的”人格”本身发起攻击——通过构建特定对话情境,诱导模型偏离安全边界,而非直接要求违规内容。
这不是漏洞利用,而是心理操纵。
对 AI 行业的影响
AI 安全正在从”防漏洞”升级为”防操纵”的阶段。对安全行业和 AI 模型厂商而言,对话层面的攻击面比代码注入更难防御,且随着 AI Agent 落地企业级应用,这一威胁的商业影响正在急剧放大。
原文参考
来源:The Verge AI · 2026-05-24
This is The Stepback, a weekly newsletter breaking down one essential story from the tech world. For more on AI mischief, follow Robert Hart. The Stepback arrives in our subscribers’ inboxes at 8AM ET. Opt in for The Stepback here. How it started Hacking the first generation of AI chatbots was a laughably simple affair. […]