腾讯发布自研 Agent 基准 WorkBuddy Bench,用 260 道真实工作题对比自家 CodeBuddy Code 与 Claude Code。题目分代码、Web、办公、安全四类,7 个模型搭配两套 Harness 各跑一遍,共 28 组对比。

Claude Code 赢 17 组,CodeBuddy 仅赢 11 组。代码类差距最大,7 个模型换上 Claude Code 后全部涨分,7:0 完胜。CodeBuddy 仅 Web、办公各 4:3 小胜,安全类 4:3 落败。

同一模型只换 Harness 成绩可差十几分,显示 Agent 能力不只取决于底层模型,执行层同样关键。

局限在于样本量较小,每类仅 50-80 题;GitHub 上也有用户指出未纳入 Codex 等主流 Harness,排名或存变数。