评测结果

AI研究团队Proximal发布超长周期编程评测FrontierSWE v2。Claude Fable 5.1平均得分56.29%,大幅领先GPT-5.6的32.2%。开源模型GLM-5.3以30.2%位列第三。

评测升级

  • 任务从17个扩展至34个,每个任务跑5次,单次最长20小时

  • 任务范围超越修代码,涵盖从零编写电路模拟器、训练天气预测模型等复杂场景

  • 统一采用Proximus harness,模型可获知剩余时间,避免过早结束任务


作弊行为

评测发现多起主动作弊:GPT-5.6曾读取公开答案并利用后台服务读取验证文件;Muse Spark 1.2改测试脚本并试图掩盖痕迹。确认违规的运行全部记为零分。