DeepSeek V4-Flash 0731 基准测试解读:Agent 能力跃升与横向对比
DeepSeek V4-Flash 0731 基准测试解读:Agent 能力跃升与横向对比
1. 更新概述
DeepSeek V4-Flash 0731 正式版发布,大幅增强了 Agent 能力。模型架构和尺寸不变,仍是 284B 总参数、13B 激活参数,这次只做了后训练(post-training)。9 项基准测试全部上涨,涨幅远超小版本修修补补的幅度。
2. 纵向对比:与自己比
把所有旧版本和当前版本的成绩放在一起对比,9 项测试全部上涨。
| 基准测试 | 旧版本 | V4-Flash 0731 | 涨幅 |
|---|---|---|---|
| DeepSWE | 7.3 | 54.4 | +47.1 |
| CyberGym | — | — | +38 |
| DSBench-Hard | — | — | +33.8 |
| DSBench-FullStack | — | — | +31.7 |
| Terminal-Bench 2.1 | 61.8 | 82.7 | +20.9 |
涨幅最大的三项:DeepSWE 增加 47.1 分,CyberGym 增加 38 分,DSBench-Hard 增加 33.8 分。Terminal-Bench 2.1 从 61.8 涨到 82.7,增加 20.9 分。
核心结论:DeepSeek 没有靠堆一个更大的底座交成绩。它把训练重点压到了 Agent 执行、工具调用和长任务上。
3. 横向对比:与同期最强模型比
对比对象包括 GPT-5.6 Sol、Claude Opus 5、Kimi K3、GLM-5.2、MiniMax M3。以下选取 5 个重合度最高的 Agent 基准。
Terminal-Bench 2.1
| 模型 | 分数 |
|---|---|
| GPT-5.6 Sol | 领先 5-6 分 |
| Kimi K3 | 领先 5-6 分 |
| V4-Flash 0731 | 82.7 |
GPT-5.6 Sol 和 Kimi K3 仍领先 V4-Flash 5-6 分。
DeepSWE
| 模型 | 分数差距 |
|---|---|
| GPT-5.6 Sol | +18.6 |
| Claude Opus 5 | +14.4 |
| Kimi K3 | +13.1 |
| V4-Flash 0731 | 54.4 |
这是差距最大的一个基准,V4-Flash 在这个维度上还有明显追赶空间。
Toolathlon-Verified
| 模型 | 分数 |
|---|---|
| Claude Opus 5 | 80.6 |
| Kimi K3 | 76.5 |
| V4-Flash 0731 | 70.3 |
| GLM-5.2 | 低于 70.3 |
V4-Flash 的 70.3 已超过 GLM-5.2,距离 Kimi K3 只差 6.2 分。
Agents’ Last Exam 和 AutomationBench
在这两个基准上,V4-Flash 紧咬第一梯队,但尚未拿到第一。
| 基准 | 结论 |
|---|---|
| Agents’ Last Exam | 紧咬第一梯队 |
| AutomationBench | 紧咬第一梯队 |
核心结论:V4-Flash 已经进入第一梯队的讨论范围,但还没有把最强的几个模型干下去。最难的长链条工程任务,GPT-5.6 Sol、Opus 5 和 Kimi K3 依然首选。
4. 性价比分析
能力大涨,价格一分没涨。
| 价格维度 | V4-Flash 0731 | GPT-5.6 Luna | 差距 |
|---|---|---|---|
| 缓存未命中输入 | 0.14 美元 | 0.20 美元 | 便宜 30% |
| 缓存命中输入 | 0.0028 美元 | 0.02 美元 | 便宜 86% |
| 输出 | 0.28 美元 | 1.20 美元 | 便宜 77%,约 1/4.3 |
单位:每百万 token。
核心结论:大批量跑代码检查、仓库分析、工具调用和 sub-agent,V4-Flash 开始变得非常有吸引力。
5. 选型建议
| 场景 | 推荐模型 |
|---|---|
| 最难的长链条工程任务 | GPT-5.6 Sol / Claude Opus 5 / Kimi K3 |
| 大批量代码检查、仓库分析、工具调用 | V4-Flash 0731 |
| 关注性价比的场景 | V4-Flash 0731 为首选 |
| 等待最终版本 | DeepSeek V4-Pro 正式版 |
6. 总结
- V4-Flash 0731 通过后训练而非增大底座实现 Agent 能力大幅跃升,9 项测试全部上涨
- 已进入第一梯队讨论范围,但尚未登顶
- 价格优势明显,大批量场景性价比突出
- 最难的长链条工程任务,第一梯队模型依然首选;大批量跑代码检查、工具调用,V4-Flash 极具吸引力
