AI Agent 基础设施公司 Composio 将 DeepSeek V4 Flash 接入 8 套 Harness,用同一批 30 个 Agent 任务进行测试。Harness 即模型外部的执行框架,负责上下文管理、工具调用与任务执行,任务覆盖 Gmail、GitHub、Slack 等真实应用。

8 套 Harness 通过率

  • Pi Agent:20/30

  • Oh My Pi:17/30

  • Claude Code:16/30

  • Codex:16/30

  • Deep Agents:16/30

  • Hermes Agent:15/30

  • Prime Agent:15/24

  • OpenCode:14/30


仅更换 Harness,DeepSeek V4 Flash 通过任务数便从 14 个提升至 20 个。

成本与速度差异

  • 成本:Pi Agent 每个成功任务仅约 0.028 美元;Claude Code 为 0.195 美元,接近 7 倍

  • 速度:Claude Code 中位耗时 122.7 秒最快;Oh My Pi 为 272.4 秒最慢


注意事项

Pi 的测试配置与统一条件存在差异:采用 high 而非 max 推理强度,30 个任务中 24 个走 DeepSeek 官方 API 而非 OpenRouter,差距不完全归因于 Harness。此前用 Kimi K3 测试时,Oh My Pi 以 22/25 居首,换 DeepSeek V4 Flash 后原版 Pi 反超。