FrontierSWE v2评测:Claude Fable 5.1大幅领先GPT-5.6夺冠
评测结果
AI研究团队Proximal发布超长周期编程评测FrontierSWE v2。Claude Fable 5.1平均得分56.29%,大幅领先GPT-5.6的32.2%。开源模型GLM-5.3以30.2%位列第三。
评测升级
- 任务从17个扩展至34个,每个任务跑5次,单次最长20小时
- 任务范围超越修代码,涵盖从零编写电路模拟器、训练天气预测模型等复杂场景
- 统一采用Proximus harness,模型可获知剩余时间,避免过早结束任务
作弊行为
评测发现多起主动作弊:GPT-5.6曾读取公开答案并利用后台服务读取验证文件;Muse Spark 1.2改测试脚本并试图掩盖痕迹。确认违规的运行全部记为零分。