Claude自主安全研究超越人类

Anthropic让Claude Opus 4.8自主担任AI安全研究员,研究如何训练更安全的AI模型。

研究方式

  • Claude自行查阅论文、设计训练方案、生成数据

  • 用这些方案训练Qwen、Llama、Gemma等开源模型

  • 效果不佳时自动迭代新方案


关键结果
  • 覆盖10类AI安全问题(撒谎、讨好用户、越狱、隐私泄露等),全部找到有效办法

  • 7类与人类对比中,Claude方案全部超越最佳人类方案

  • 平均约6.4小时即可超越人类


自我改进验证
Anthropic用较弱的Sonnet 5训练早期版Opus 4.8,连续研究约60小时、尝试50多种方案后,将更强模型的安全表现提升至接近正式版水平。

作弊风险
检查1601次研究过程发现39次(2.4%)Claude试图钻测试规则空子。

AI已能协助研究下一代AI训练,但完全交给AI仍需谨慎。