当前位置: 首页 > news >正文

刚刚 DeepSeek V4 Pro 0813正式发布:Pro终于把旗舰位置拿回来了

就在刚刚,DeepSeek V4 Pro 正式版上线,底层版本号为DeepSeek-V4-Pro-0813

这次不只是 API 页面换了一个日期。DeepSeek 随后放出的正式版跑分显示,0813 在代码 Agent、工具调用和自动化任务上都有明显提升。7 月底,参数更小的 V4 Flash 0731 曾在九项 Agent 测试中全面超过 Pro 预览版;不到两周,Pro 又把差距拉了回来。

先说结论:V4 Pro 0813 在 DeepSeek 自家模型中重新坐稳旗舰位置,也进入了当前 Agent 模型的第一梯队。不过,它没有全面超过 Kimi K3、Opus 4.8 和 Fable 5。

图:DeepSeek 官方公布的 V4 Pro 0813 模型对比成绩,2026 年 8 月 13 日。

这次正式发布了什么

DeepSeek 官方 API 文档已经将deepseek-v4-pro指向DeepSeek-V4-Pro-0813。原有用户不需要改模型名,也不需要更换 Base URL,重新请求时会直接使用新版本。DeepSeek API 文档

目前确认的规格如下:

项目DeepSeek V4 Pro 0813
API 模型名deepseek-v4-pro
底层版本DeepSeek-V4-Pro-0813
模型结构MoE
总参数量1.6T
每 Token 激活参数49B
上下文长度1M Token
最大输出384K Token
推理模式非思考、思考(默认)
API 支持Chat Completions、Responses、Anthropic 兼容接口
其他能力JSON Output、Tool Calls、前缀续写、FIM
输入模态文本

其中,版本号、上下文、输出上限和接口能力来自当前 API 页面;1.6T 总参数、49B 激活参数来自 DeepSeek V4 Pro 模型卡。官方暂未说明 0813 是否调整了基础架构,从跑分变化的位置看,这轮升级的重点显然落在了后训练和 Agent 能力上。DeepSeek 模型与价格|V4 Pro 官方模型卡

Pro 预览版到 0813:有几项几乎换了一个模型

先看 DeepSeek 内部的纵向对比。除 HLE 外,下面的分数均为单项成绩,越高越好;HLE 分别列出不使用工具和使用工具的成绩。

BenchmarkV4 Pro 0813V4 Flash 0731V4 Pro Preview0813 相比 Pro Preview
HLE(不用/使用工具)42.7 / 60.037.8 / 51.537.7 / 48.2+5.0 / +11.8
Terminal Bench 2.187.982.772.1+15.8
NL2Repo61.554.238.5+23.0
Cybergym83.376.752.7+30.6
DeepSWE62.754.412.8+49.9
Toolathlon-Verified74.170.355.9+18.2
Agents’ Last Exam25.725.216.5+9.2
AutomationBench(Public)31.825.112.8+19.0
DSBench-FullStack71.168.741.8+29.3
DSBench-Hard67.259.631.1+36.1

最夸张的是 DeepSWE:12.8 涨到 62.7,增加了 49.9 分。Cybergym、DSBench-FullStack 和 DSBench-Hard 也分别提高 30.6、29.3 和 36.1 分。这几项都涉及较长链路的代码修改、环境操作或工具调用,刚好也是 V4 Pro 预览版最容易掉链子的地方。

这组变化很难用“多想一会儿”解释。更合理的判断是,0813 进行了面向代码 Agent 的大规模后训练,补齐了预览版在工具使用和长任务执行上的短板。

相比 V4 Flash 0731,Pro 0813 在表中所有项目也都领先,但差距没有它对预览版那么夸张:Terminal Bench 高 5.2 分,DeepSWE 高 8.3 分,DSBench-FullStack 只高 2.4 分,Agents’ Last Exam 更是只高 0.5 分。

所以 Flash 0731 并没有突然失去价值。它仍是更便宜、更快的选择;Pro 的优势主要出现在更难、更长、失败成本更高的任务里。

和 GLM、Kimi、Claude 放在一起,V4 Pro 到了什么位置

官方图同时列出了 GLM 5.2、Kimi K3、Opus 4.8,以及带 fallback 的 Fable 5。完整成绩如下:

BenchmarkV4 Pro 0813GLM 5.2Kimi K3Opus 4.8Fable 5(含 fallback)
HLE(不用/使用工具)42.7 / 60.040.5 / 54.743.5 / 56.049.8 / 57.953.3 / 63.0
Terminal Bench 2.187.981.088.385.088.0
NL2Repo61.548.969.7
Cybergym83.380.078.383.1
DeepSWE62.746.267.558.070.0
Toolathlon-Verified74.159.976.576.277.9
Agents’ Last Exam25.723.827.625.7
AutomationBench(Public)31.812.930.827.229.1
DSBench-FullStack71.161.873.771.677.2
DSBench-Hard67.254.563.071.768.3

V4 Pro 0813 有两个明确的单项第一:

  • Cybergym 83.3,略高于 Fable 5 的 83.1;
  • AutomationBench Public 31.8,高于 Kimi K3 的 30.8、Fable 5 的 29.1 和 Opus 4.8 的 27.2。

Terminal Bench 2.1 的 87.9 也已经贴近最高水平:比 Opus 4.8 高 2.9 分,距离 Kimi K3 只有 0.4 分,距离 Fable 5 只有 0.1 分。

短板同样很清楚。HLE 不使用工具时,V4 Pro 0813 只有 42.7,落后 Opus 4.8 的 49.8 和 Fable 5 的 53.3;DeepSWE、Toolathlon 和 DSBench-FullStack 也没有拿到第一。NL2Repo 则以 61.5 落后 Opus 4.8 的 69.7。

这不是一张“DeepSeek 全面碾压”的表。更准确的说法是:V4 Pro 0813 在终端操作、安全和自动化工作流上已经能和头部闭源模型正面对打,但在纯知识推理与部分复杂软件工程任务上仍有差距。

这张跑分表还要注意三件事

第一,数据来自 DeepSeek 官方,并非第三方独立复测。厂商跑分适合判断模型升级方向,最后是否好用,仍要看同一套 Agent 框架和真实项目里的复现结果。

第二,Fable 5 一栏明确写有w/ fallback,说明部分任务可能触发后备模型。它和单一模型的直接比较需要留一点余地。

第三,DSBench-FullStack 与 DSBench-Hard 是 DeepSeek 自有测试集。它们能反映内部优化成果,但外部目前无法像公开 Benchmark 那样完整核验。真正值得优先看的,是 Terminal Bench、DeepSWE、Toolathlon、HLE 等公开项目。

截至发稿,Artificial Analysis 的 V4 Pro 页面仍显示 4 月版本,尚未明确标注完成 0813 重测。此前“Flash 0731 综合分高于 Pro”的第三方结论,现在只能视为旧版 Pro 的历史成绩,不能再拿来代表 0813。Artificial Analysis:V4 Pro

价格没变:Pro 仍然便宜,但不再是 Flash 的平替

DeepSeek 当前的人民币 API 价格如下:

每百万 TokenV4 Flash 0731V4 Pro 0813
输入,缓存命中0.02 元0.025 元
输入,缓存未命中1 元3 元
输出2 元6 元
并发上限2500500

Pro 的缓存命中价只比 Flash 高 0.005 元,但缓存未命中输入和输出都是 Flash 的三倍。对于会反复读取同一个代码仓库、长文档或系统提示词的 Agent,缓存命中价格很有吸引力;普通聊天、批量生成和高并发接口,Flash 依旧更划算。DeepSeek 官方价格页

需要留意的是,官方已经在价格页提示:近期计划整体上调 API 定价,而且“预计涨幅较大”。因此,当前 3 元输入、6 元输出的 Pro 价格不一定会维持很久。

已接入的项目不用改代码

DeepSeek 继续使用滚动模型名deepseek-v4-pro。原来的 Java、Python 或 Node.js 项目不需要迁移接口,只要正常发起请求,就会访问最新的 0813 版本。

{"model":"deepseek-v4-pro","messages":[{"role":"user","content":"阅读这个代码仓库,定位订单重复扣款的原因并提交修复方案"}],"thinking":{"type":"enabled"},"reasoning_effort":"max","stream":true}

OpenAI 兼容接口仍是https://api.deepseek.com,Anthropic 兼容接口为https://api.deepseek.com/anthropic

滚动升级虽然省事,生产环境仍建议保留版本切换前后的回归样例。0813 对 Agent 行为改动很大,同一条提示词的工具选择、思考长度和输出格式都可能变化。至少应重新测试函数调用、JSON 输出、超时设置和 Token 上限,不要只看接口是否返回 200。

最后说几句

V4 Pro 0813 最重要的变化,是把预览版“题做得不错,但 Agent 容易翻车”的印象扭了回来。

DeepSWE 从 12.8 到 62.7,Cybergym 从 52.7 到 83.3,Terminal Bench 从 72.1 到 87.9。这不是边角修补。虽然 DeepSeek 还没有公布 0813 的完整训练细节,但从提升集中的项目看,代码 Agent 显然是这轮更新的主线。Flash 0731 先展示了后训练带来的跃升,Pro 0813 随后又把上限往前推了一截。

当然,官方跑分只是第一张成绩单。V4 Pro 0813 能否在不同 Agent 框架、真实代码库和长时间任务中保持稳定,还要等第三方复测。至少从今天这张表看,DeepSeek 已经回答了一个最直接的问题:

Pro 为什么叫 Pro?这次终于有一组说得过去的答案了。


资料来源

  1. DeepSeek 官方发布的 V4 Pro 0813 跑分对比图,2026 年 8 月 13 日
  2. DeepSeek:首次调用 API
  3. DeepSeek:模型与价格
  4. DeepSeek:更新日志
  5. DeepSeek V4 Pro 官方模型卡
  6. DeepSeek V4 Flash 0731 官方模型卡
  7. Artificial Analysis:DeepSeek V4 Pro

信息核验时间:2026 年 8 月 13 日。模型版本、价格和第三方榜单可能继续更新。

http://www.jsqmd.com/news/1393025/

相关文章:

  • 10.5M参数的轻量级图像分类模型gcresnext26ts.ch_in1k,凭什么在ImageNet-1k上站稳脚跟?
  • 2026北京离婚律师推荐:专攻房产分割的实战派测评 - 品牌品鉴馆
  • 2026年安徽工贸职业技术学院公办复读班/预科班报考指南 - 我叫小周
  • 婴童润护洗发沐浴露哪家好:【蜜妙诗】适配孩童嫩肌 - 18002239949
  • 告别单调标题栏!DWMBlurGlass免费为Windows 10/11全局窗口添加毛玻璃特效
  • 一台服务器统一管起海康大华宇视:用WVP-GB28181-Pro搭建国标视频监控平台的完整实战
  • KKCE: TCPing,全球3000+节点-快快测
  • 婴童润护洗发沐浴露哪家好:【蜜妙诗】泡沫绵密亲肤 - 17728098551
  • MediaCrawler 从零到上手:五大平台社交媒体数据采集终极指南
  • IntelliJ IDEA 快速启动与内存优化
  • mri vs minimist vs yargs-parser:终极Node.js CLI解析工具性能对比
  • 编程初学相关问题及其解答
  • DeepAgents框架架构06:防御式边界架构
  • AIGC驱动UI测试
  • 力扣刷题#33-0098-验证二叉搜索树
  • AI全自动短视频创作终极指南:零基础用Pixelle-Video一键生成完整视频
  • 推荐本地口碑最好的新房装修瓷砖店铺 - 品牌品鉴馆
  • 灵犀专业版首发接入GLM-5.3:代码能力加持,复杂办公任务一次跑通
  • 第七史诗自动化脚本E7Helper上手全攻略:挂机刷图、刷书签、QQ通知一篇讲透
  • 爱回收上门和估价差的多吗?回收行业从业者的实测复盘 - 品牌品鉴馆
  • RISC-V机械臂全新亮相:myCobot 280软硬件全面开源,开启AI新篇章
  • 提升出图效率300%:KSampler (Efficient)节点实战指南,含实时预览与种子管理技巧
  • python的工业过程控制场景模拟第一百四十篇:污水处理溶解氧优化控制仿真,在满足工艺前提下动态降低风机输出节约电能。(140系列完毕)
  • 技术人做产品选型,功能表之后还要算使用成本
  • vConsole移动端调试完整指南:从安装到面板控制的实践手册
  • JeecgBoot 全文检索实战:从数据库 LIKE 到 Elasticsearch 集成的完整迁移
  • Moonlight 主题安装配置实战:5 分钟把 VS Code 换成月光下的泡泡糖配色
  • openEuler_编译64K内核包(spec文件构建)
  • Ruby 4.0 通用 RCE 反序列化利用链:突破版本限制,深入底层构建
  • Rai Pal高级技巧:离线模组加载、本地数据库管理与Wine前缀优化