测试结果

Artificial Analysis 完成 DeepSeek V4.1 Flash 独立测试,综合智能指数 40 分。

  • 超过自家 V4 Pro 0813 的 36 分

  • 低于 Kimi K3 的 44 分、GLM-5.3 的 45 分


按该第三方榜单,DeepSeek 尚未夺回国产模型第一。

成本与速度

  • 单任务平均成本 0.27 美元,Kimi K3 与 GLM-5.3 均在 2 美元左右,相差约 7 倍

  • 输出速度 197 Token/s,远高于 Kimi K3 的约 36 Token/s、GLM-5.3 的约 58 Token/s


Agent 与短板

AutomationBench-AA 得分 69%,追平 GPT-6 Astra,超过 GLM-5.3 的 62%;长上下文测试 AA-LCR 拿到 84%。

短板是输出冗长:单任务平均输出约 8.9 万 Token,比 V4 Pro 多 62%,吃掉部分价格优势。