Scale推出RSI Bench,测试AI自我改进能力
Scale推出RSI Bench,AI自我改进能力迎来量化测试
Scale AI 正式推出 RSI Bench 基准测试,专门评估 AI 模型能否像研究员一样自主开展 AI 研发工作。
测试机制
- 模型直接获取论文、代码和算力资源
- 自主设计实验、运行训练、调整方法
- 目标:将原有 AI 模型优化得更好
首批测试结果
首轮测试覆盖 Claude Opus 5 和 GPT-5.6 Sol 两款模型。结果显示:
- 已具备能力:自主跑实验、调参数、迭代方案,部分任务表现超过给定基线
- 仍存短板:面对最新研究挑战时,多数尝试停留在复现论文方法和参数调优层面,鲜少提出真正原创的技术思路
RSI Bench 的推出,为衡量 AI 自我改进能力提供了标准化工具。当前阶段,AI 距离真正的「自我发明」仍有距离。