OpenAI 用 GPT-Red 训练模型更安全

Meet GPT-Red: an LLM super-hacker OpenAI built to make its models safer

来源 MIT Technology Review 日期 英语原文

OpenAI 开发了一个名为 GPT-Red 的大模型“超级黑客”,用来模拟攻击并帮助其他模型增强防御能力。

MIT Technology Review 报道称,OpenAI 构建了一个名为 GPT-Red 的 LLM 工具,把它当作对抗性“陪练”,用来帮助其他模型提升对网络攻击的防御能力。OpenAI 还表示,最新旗舰模型 GPT-5.6 通过与 GPT-Red 对抗训练后,成为其迄今最稳健的版本。

对 AI 行业的影响

这类对抗式训练会把模型安全从事后补丁推进到训练阶段的系统工程。受影响的包括前沿模型实验室、企业安全团队和红队服务提供方,因为安全能力将越来越成为模型发布的核心卖点。长期看,谁能把攻防训练做成可规模化流程,谁就更容易在高风险行业落地。


原文参考

来源:MIT Technology Review · 2026-07-15

OpenAI has built an LLM super-hacker called GPT-Red that it uses as a sparring partner to help its other models boost their defenses against cyberattacks. Last week the company released the latest version of its flagship LLM, GPT-5.6. OpenAI says that training it against GPT-Red made the model its most robust release yet. GPT-Red automates…