DeepSeek V4.1 Flash实测:智能指数40分,成本仅对手七分之一
测试结果
Artificial Analysis 完成 DeepSeek V4.1 Flash 独立测试,综合智能指数 40 分。
- 超过自家 V4 Pro 0813 的 36 分
- 低于 Kimi K3 的 44 分、GLM-5.3 的 45 分
按该第三方榜单,DeepSeek 尚未夺回国产模型第一。
成本与速度
- 单任务平均成本 0.27 美元,Kimi K3 与 GLM-5.3 均在 2 美元左右,相差约 7 倍
- 输出速度 197 Token/s,远高于 Kimi K3 的约 36 Token/s、GLM-5.3 的约 58 Token/s
Agent 与短板
AutomationBench-AA 得分 69%,追平 GPT-6 Astra,超过 GLM-5.3 的 62%;长上下文测试 AA-LCR 拿到 84%。
短板是输出冗长:单任务平均输出约 8.9 万 Token,比 V4 Pro 多 62%,吃掉部分价格优势。