Scale推出RSI Bench,AI自我改进能力迎来量化测试

Scale AI 正式推出 RSI Bench 基准测试,专门评估 AI 模型能否像研究员一样自主开展 AI 研发工作。

测试机制

  • 模型直接获取论文、代码和算力资源

  • 自主设计实验、运行训练、调整方法

  • 目标:将原有 AI 模型优化得更好


首批测试结果

首轮测试覆盖 Claude Opus 5 和 GPT-5.6 Sol 两款模型。结果显示:

  • 已具备能力:自主跑实验、调参数、迭代方案,部分任务表现超过给定基线

  • 仍存短板:面对最新研究挑战时,多数尝试停留在复现论文方法和参数调优层面,鲜少提出真正原创的技术思路


RSI Bench 的推出,为衡量 AI 自我改进能力提供了标准化工具。当前阶段,AI 距离真正的「自我发明」仍有距离。