研究人员展示可自我改进的人工智能
An Anthropic researcher just gave us a peek at self-improving AI
在针对10种特定不一致行为的基准测试中,自动化系统在没有降低整体表现的情况下,全部实现了性能提升。
据 TechCrunch AI 报道,研究人员展示了一类能够改进自身表现的自动化系统。系统面对10项针对特定不一致行为的基准测试时,均提升了表现,同时没有损害整体性能。现有信息未说明系统的具体方法、改进幅度或测试范围。
对 AI 行业的影响
如果这一结果能够在更广泛的测试中复现,影响机制将是自动化评测与优化可能减少模型改进对人工调参的依赖;模型开发者和安全研究者将面临更快的能力迭代与更高的验证压力。上述判断属于基于报道事实的推论。
原文参考
来源:TechCrunch AI · 2026-08-28
Given 10 benchmarks for specific misaligned behaviors, the automated systems were able to improve performance on every single one without degrading overall performance.