Terminal-Bench 4.0 发布,GLM-5.3 升至第三

Terminal-Bench 发布 4.0 版本,重新校准 Agent 执行任务时的时间、CPU 和内存指标,统一所有任务最长执行时间为 8 小时,并修复 19 个任务、移除 8 个存在饱和或质量问题的任务。

最新排名

  • Opus 5 + Claude Code:51.8%,第一

  • Fable 5:44.5%,第二

  • GLM-5.3 + Claude Code:41.8%,第三

  • GPT-5.6 Sol + Codex:37.3%,第四


GLM-5.3 是前三名中唯一非 Anthropic 模型,与 Claude Code 组合而非自家 Agent 框架。对比 3.0 版本,GLM-5.3 从 32.4% 第四名(落后 GPT-5.6 Sol 2.2 个百分点)升至第三,反超 4.5 个百分点。新规则将资源维度纳入评测,更强调真实工程约束下的执行效率。