DeepSeek V4-Pro 转正:号称追平 Claude Fable 5,但跑分只有一家在说
💡一句话总结:DeepSeek V4-Pro 旗舰模型今天正式 GA,Agent 能力据报暴涨(DeepSWE 从 12.8 飙到 62.7),价格比 Claude Fable 5 便宜约 46 倍——但所有跑分都是 DeepSeek 自己发的,还没有任何第三方验证过。便宜是真的,强不强得再等等。
导语:你的 API 账单还好吗?
如果你是一个天天挂着 Claude Code 或者 GPT 写代码的人,最近几个月大概率有过一个念头:“这 API 账单能不能便宜点?”
Anthropic 的 Fable 5 输出 token 要 $50 每百万——跑一轮复杂的 agent 工作流,几十刀就没了。GPT-5.6 Luna 刚降了价,输入 $0.2/M 输出 $1.2/M,已经很有诚意了。但 DeepSeek V4-Flash 的 $0.14/$0.28 直接把地板价又踩穿了一层。
然后今天(8 月 12-13 日),DeepSeek 的旗舰模型 V4-Pro 也正式转正了——版本号 0813,从预览版变成了 GA(General Availability)。号称 Agent 能力暴涨,号称追平甚至部分超越 Claude Fable 5,号称只要 Fable 5 的 1/46 价格。
听起来是不是太好了?所以这篇就帮你看懂:什么是真的、什么有水分、什么完全还没验证。
想自己动手试?
- 🌐 官方定价页:DeepSeek API Pricing
- 🔌 多供应商入口:OpenRouter — DeepSeek V4 Pro
- 📝 KOL 快评:Simon Willison — V4 Pro 0813
- 📊 详细验证报告:The Cherry Creek News — 0813 GA 分析
🚀 今天到底发生了什么
一句话:DeepSeek V4-Pro 从"预览版"转正成"正式版"了。
具体说,DeepSeek 在自己的 API 定价页上把deepseek-v4-pro端点的版本号更新成了DeepSeek-V4-Pro-0813。OpenRouter 也同步上线,描述里白纸黑字写着 “This is the GA release of DeepSeek V4 Pro”。同时,DeepSeek Chat 网页版和客户端也用上了这个版本——普通用户打开就能免费用到,DeepSeek 至今没有消费级付费订阅,chat 是完全免费的。
模型本身没有架构变化:仍然是 MoE(混合专家架构,简单说就是总参数巨大但每次推理只激活一小部分专家上场),1.6 万亿总参数、490 亿激活,100 万 token 上下文窗口,最大输出 38.4 万 token。MIT 开源许可。这些都和 4 月 24 日预览版发布时一致。
变的是后训练和 Agent 能力。DeepSeek 自己发布了一组对比图表——把 0813 和 4 月的预览版做了基准对比:
| 基准 | 预览版 | 0813 GA | 涨幅 |
|---|---|---|---|
| Terminal-Bench 2.1 | 72.1 | 87.9 | +15.8 |
| CyberGym | 52.7 | 83.3 | +30.6 |
| DeepSWE | 12.8 | 62.7 | +49.9 |
| AutomationBench | 12.8 | 31.8 | +19.0 |
| DSBench-Hard | 31.1 | 67.2 | +36.1 |
DeepSWE 从 12.8 涨到 62.7——接近 50 个百分点的跳升,这种增幅在 AI 基准里几乎闻所未闻。但请先记住这个数字,后面会说到它的来源问题。
有意思的是,这次 GA 还有一个"家务事"的背景。7 月 31 日 DeepSeek 把更便宜的 V4-Flash 先转正了(公测版),结果 Flash 在 9 项 Agent 基准上反超了自己的旗舰大哥 Pro 预览版。旗舰模型被自家小弟打脸,两周后 V4-Pro-0813 就带着暴涨的 Agent 跑分来了——核心叙事就是"旗舰夺回了 Agent 王座"。DeepSeek 官方没这么说过,但这个时间线和数据走向,你品。
💰 便宜到什么程度?先把那个"1/57"的口号掰扯清楚
网上流传一个说法:“V4-Pro 是 Fable 5 价格的 1/57”。这个数字有没有道理?有,但它是被高度压缩过的。
kingy.ai 做了个事实核查,结论是这样的:
- 输出 token 单独算:V4-Pro $0.87/M vs Fable 5 $50/M,确实是大约 1/57
- 输入 token 单独算:V4-Pro $0.435/M vs Fable 5 $10/M,大约是 1/23
- 混合负载实际算(输入+输出综合):大约1/46
所以"异常便宜"这个定性判断完全成立——但"1/57"把三个不同口径的数字压缩成了一个,严格来说是误导。更准确的说法是“大约 1/46”。
给你一个更直观的参照:
| 模型 | 输入 $/M | 输出 $/M | 备注 |
|---|---|---|---|
| DeepSeek V4-Pro | $0.435 | $0.87 | 永久价(原价 $1.74/$3.48) |
| DeepSeek V4-Flash | $0.14 | $0.28 | 比 Pro 还便宜 3 倍 |
| GPT-5.6 Luna | $0.2 | $1.2 | 刚降过价 |
| Claude Fable 5 | $10 | $50 | 前沿旗舰 |
| Kimi K3 | $3 | $15 | 中国同梯竞品 |
5 月 22 日,DeepSeek 把 V4-Pro 的 75% 促销折扣变成了永久价——不是限时活动了,是长期 list price。这意味着你可以放心签 12 个月的企业合同了,不用担心下个月价格弹回去。
但是(总是有但是的):DeepSeek 定价页上同时挂了一条声明——“计划在近期上调整体 API 定价,预计会有显著增长”。具体涨多少、什么时候涨,都没说。所以当前这个价格更像是"窗口期价格",而不是永久承诺。
🤖 Agent 跑分暴涨?先看看数据是怎么来的
回到那个 DeepSWE 从 12.8 飙到 62.7 的数字。这个增幅大不大?大得离谱。能不能信?目前只能信一半——“数字确实是 DeepSeek 发的”,但"有没有那么强"还没有任何人独立验证过。
几个事实帮你判断这些数据的质量:
- 来源是 DeepSeek 自己的对比图表,通过官方 WeChat 群和 X 账号发布,被博客转载传播。Reddit 上有人搬运,被版主以"低质量"为由删除了
- benchable.ai 上该模型的页面是空的——第三方基准平台还没有任何结果
- DeepSeek 官方 changelog 没有 GA 发布的条目——最后一次更新还停在 7 月 31 日 Flash 公测的公告
- 0813 的开源权重还没发布——HuggingFace 上仍然托管的是 4 月预览权重,月下载超 140 万次的也是那个旧版本
- 对比基线是自家预览版,不是竞品——也就是说"涨了 50 个百分点"的参照物是自己的旧版本,不是 Fable 5 或 GPT-5.6
更值得注意的一个细节:那组 Agent 图表用的是 Terminal-Bench2.1,而 4 月预览版发布时的标准基准表用的是 Terminal-Bench2.0——不同版本,分数不可直接比较。所以你看到"预览版 Terminal-Bench 67.9"和"0813 Terminal-Bench 87.9"时,别急着算差值,它们用的可能不是同一套卷子。
Simon Willison(知名 AI 博主)在他的博客里提到一个耐人寻味的细节:他测试时发现 V4-Pro 在不同推理强度(low/medium/high)下生成的图片差异极大——“没有其他模型有这种程度的差异”。这意味着推理强度对输出质量的影响可能比其他模型显著得多,选对档位很重要。
总结一下数据可信度:DeepSeek 自己的标准基准(4 月发布的 SWE-Bench、LiveCodeBench 等)已经被多个第三方验证过,大体靠谱。但 0813 的 Agent 大幅提升数据目前完全是孤证——只有 DeepSeek 一家在说,没有任何人复现。
👨💻 开发者社区怎么说
Hacker News 是这次讨论的主战场。V4 系列今年 4 月首发的主帖拿到了 2091 分和 1607 条评论——HN 近期最热的 AI 话题之一。社区反馈大致是6 成正面、3 成谨慎、1 成负面。
说好的那拨人主要激动于成本:
- “在 max reasoning 设置下,我的 credit 余额几乎不动”——这是真实 API 用户反馈
- 有人估算,加上 agentic 工作流中典型的缓存命中率,实际花费比 Claude Opus 便宜约 60 倍
- DeepClaude 项目(把 V4-Pro 塞进 Claude Code 的 agent loop 里跑)在 HN 拿了 678 分,说明"用 DeepSeek 引擎跑 Claude Code"的需求真实存在
- LiveCodeBench 93.5 分是同表所有模型最高,Codeforces rating 3206 也压过 GPT-5.4 的 3168
说不好的那拨人给了一个特别有杀伤力的真实对比:
“Deepseek 4 pro:跑了 12 分 02 秒,花了 $0.12——有 bug。Grok 4.6:跑了 3 分 18 秒,花了 $1.41——没 bug。”
十二美分跑出来一个带 bug 的结果,和一块四跑出来一个干净的结果——这个对比精准地命中了"便宜 ≠ 好"的痛点。当然,正如另一位 HN 用户说的:“这是非确定性系统,单次试验不能大幅更新你的先验。” 一个样本说明不了什么,但至少提醒我们:跑分和实际使用体验之间可以有巨大鸿沟。
还有几个反复被提到的关切:
- 隐私政策:“DeepSeek 的隐私政策异常糟糕——他们可以用你的 prompt 和补全做训练。” 对企业级敏感数据来说,这是一条硬伤
- 推理速度:高负载时段明显变慢。DeepSeek 的计算资源只有约 2 万张 H100,在高并发下推理会"慢到爬行"
- 基准方法论质疑:有人指出"harness(测试框架)的权重几乎和模型本身一样大",意思是你换个测试工具链可能分数完全不一样
📌 几个你该知道的信号
在你考虑要不要切到 V4-Pro 之前,有几个信号值得放在心上:
第一,DeepSeek 7 月的 token 消耗量已经仅次于 Anthropic,8 月大概率登顶。这意味着它正在获取全球最大规模的用户交互数据——这些数据直接喂给后训练,可能形成"用户越多→数据越多→模型越强→用户更多"的飞轮。从行业竞争角度看,这是一个值得关注的结构性优势。
第二,V4-Flash 可能是更务实的选择。Flash 只要 $0.14/$0.28 每百万 token(比 Pro 还便宜 3 倍),而且 Terminal-Bench 2.1 已经到了 82.7——和 Pro 的 87.9 差距不大。如果你的工作负载是日常编码、分类、摘要、RAG 检索,Flash 的性价比可能比 Pro 更高。Pro 真正的价值在于最难的 agentic 长链任务,那种需要几百步工具调用的场景。
第三,0813 的开源权重还没出来。如果你是要自托管的研究者或企业,现在能用的还是 4 月的预览权重。DeepSeek 没说什么时候发 0813 权重,也没说 GA 版和预览版在模型本体上是否有区别——可能只是后训练不同,也可能是全新 checkpoint。
第四,今天是"三连发"的一天。除了 V4-Pro GA,Grok 4.6 也发布了(Intelligence Index 61,只有 GPT-5.6 Sol 价格的五分之一),阿里也上线了第一个开源 Qwen-Max。三家公司同日发旗舰——AI 模型的迭代节奏已经从"季度旗舰"加速到"月度旗舰"了。这对消费者是好事,但也意味着你现在选的模型,下个月可能就不再是性价比最优了。
把话说明白
回到开头那个问题:“这 API 账单能不能便宜点?”
答案是:能,而且便宜得超出预期。V4-Pro 的定价在当前市场上确实是碾压级的——同等质量的工作负载花不到 Fable 5 的零头,这不是营销话术,是定价页上白纸黑字的数字。Reuters 引用研究机构的结论也说"DeepSeek 是知名模型中运行成本最低的"。
但"便宜"和"好用"之间还有一段路。Agent 能力暴涨的数据目前只有 DeepSeek 自己在说,benchable.ai 空空如也,社区实测也有"十二美分跑出 bug"的案例。V4-Pro 在编程基准上的实力(LiveCodeBench 全场最高、Codeforces 领先 GPT-5.4)是多方验证过的;但 0813 新增的 Agent 提升是否如报所述,还需要时间检验。
一个务实的做法:先用起来,用你自己的真实工作负载测,别只看跑分表。DeepSeek Chat 是免费的,API 成本低到你可以在 max reasoning 下跑几十轮都不心疼。如果在你自己的任务上 V4-Pro 的表现够用——那这个价格就是真的香。如果在你的场景下频繁出 bug 或者速度慢到影响效率——那再便宜也不值。
毕竟,AI 模型是非确定性系统。你的场景、你的 prompt、你的任务复杂度,才是最终的决定因素。跑分表只是参考——而参考的价值,取决于参考本身站不站得住。
参考来源
- DeepSeek API 定价页(一手/官方)— https://api-docs.deepseek.com/quick_start/pricing
- OpenRouter DeepSeek V4 Pro 模型页(一手/平台)— https://openrouter.ai/deepseek/deepseek-v4-pro
- Unite.AI — DeepSeek Ships V4 Pro as Its Flagship Model Leaves Preview(垂直媒体)— https://www.unite.ai/deepseek-ships-v4-pro-as-its-flagship-model-leaves-preview/
- Wccftech — V4-Pro-0813 定价与 token 消耗分析(垂直媒体)— https://wccftech.com/deepseek-prices-its-new-v4-pro-0813-model-at-0-87-per-1-million-output-tokens-as-the-high-flying-chinese-ai-lab-wows-with-its-soaring-token-consumption/
- Simon Willison’s Weblog — V4 Pro 0813 快评(社区/KOL)— https://simonwillison.net/2026/Aug/12/deepseek-v4-pro-0813/
- The Cherry Creek News — 0813 GA 详细验证报告(垂直/分析)— https://thecherrycreeknews.com/deepseek-v4-pro-0813-ga-pricing-benchmarks-analysis-cherry_creek/
- DeepSeek Benchmarks 2026 — 标准基准全表(垂直/分析)— https://deepseekai.guide/news/deepseek-benchmarks-2026/
- Hacker News V4 主帖(社区)— https://news.ycombinator.com/item?id=47884971
作者:lusca
版本:lusca-report-blog v1.0.0
出处:https://github.com/yjmm10/lusca-skill/tree/main/skills/lusca-report-blog
