Terminal-Bench 4.0发布 GLM-5.3冲进前三超越GPT-5.6
Terminal-Bench 4.0 发布,GLM-5.3 升至第三
Terminal-Bench 发布 4.0 版本,重新校准 Agent 执行任务时的时间、CPU 和内存指标,统一所有任务最长执行时间为 8 小时,并修复 19 个任务、移除 8 个存在饱和或质量问题的任务。
最新排名
- Opus 5 + Claude Code:51.8%,第一
- Fable 5:44.5%,第二
- GLM-5.3 + Claude Code:41.8%,第三
- GPT-5.6 Sol + Codex:37.3%,第四
GLM-5.3 是前三名中唯一非 Anthropic 模型,与 Claude Code 组合而非自家 Agent 框架。对比 3.0 版本,GLM-5.3 从 32.4% 第四名(落后 GPT-5.6 Sol 2.2 个百分点)升至第三,反超 4.5 个百分点。新规则将资源维度纳入评测,更强调真实工程约束下的执行效率。