事件概述

OpenAI 自9月3日发布 GPT-6 Astra 后,多项模型评测基准数据被持续调整。部分修改使 Astra 表现更优,却让 Anthropic 等竞争对手模型成绩下滑,引发外界对 AI"刷榜"和评测透明度的质疑。

数据变动细节

  • 幻觉率调整:Astra 幻觉率曾从 4.2% 下调至 2%,GPT-5.6 Sol 从 12.2% 降至 9.4%,随后两者均恢复原值

  • 数学评测波动:Anthropic 的 Fable 5.1 得分一度从 87.8% 降至 78%,后回升至 83%

  • ARC-AGI-3 成绩:Astra 从发布前草稿的 98.6% 提升至最终页面的 99.99%,但该基准统一标准框架下其得分仅为 62.7%


各方回应

OpenAI 称评测结果受模型版本、工具配置、推理级别及测试运行等因素影响,调整是为确保数据准确反映模型最佳性能。斯坦福大学研究人员则认为,频繁重跑评测可能涉及"Benchmaxxing"——通过调整测试条件最大化基准成绩。

业内人士指出,AI 模型竞争加剧下,评测数据已成衡量能力与争夺市场的重要工具,基准测试的透明度和可复现性正受到越来越多关注。