DeepSeek V4 Pro 正式版发布:Agent 能力跃升、双协议兼容,全面拆解 0813 版本
DeepSeek-V4-Pro-0813 于 2026 年 8 月 13 日凌晨无预告发布,是 V4 系列旗舰模型的首个正式版本,承接 4 月 24 日上线的预览版;核心变化是 Agent 能力的大幅跃升——DeepSWE 从 12.8 跳至 62.7(+390%)、NL2Repo 从 38.5 升至 61.5、DSBench-Hard 升至 67.2——架构与参数量未变(1.6T MoE、激活 ~49B),改变来自针对性后训练;定价维持 ¥3 元/百万 token(输入)、¥6 元/百万 token(输出),官方同步宣告"近期将大幅涨价";API 新增 Responses API 与 Anthropic API 双协议支持,已兼容 Codex 和 Claude Code 等主流编程工具;同期 DeepSeek Harness 极简模式亦随文档首次亮相。
这次更新了什么:不是新模型,是新后训练
V4-Pro-0813 与 4 月的预览版共用同一模型架构和参数规模,官方说明变化来自后训练阶段的重做:
- 参数量:总参数 1.6T(MoE 架构),每 token 激活约 49B
- 上下文窗口:1M token,最大输出 384K token
- 推理模式:三档——Non-Think(快速响应)/ Think High(复杂分支)/ Think Max(最深推理)
- 架构特性:CSA(压缩稀疏注意力)+ HCA(高度压缩注意力)混合,相较 V3.2 架构,FLOPs 降至约 27%,KV Cache 需求降至约 10%
模型结构没有变,但 Agent 相关的后训练数据和策略做了针对性改造。DeepSWE +390% 的跳升,是后训练而非架构升级所驱动的。
Agent 基准:从不及格到领跑
官方公布了与预览版的对比数据:
| 测试集 | 预览版(4月) | 正式版(0813) | 涨幅 |
|---|---|---|---|
| DeepSWE(软件工程 Agent) | 12.8 | 62.7 | +390% |
| NL2Repo(自然语言生成仓库) | 38.5 | 61.5 | +60% |
| DSBench-Hard(全栈高难编码) | ~33(推算) | 67.2 | ~翻倍 |
DeepSWE 是 DeepSeek 自研的软件工程 Agent 基准,以复杂多步骤代码修改任务为主,12.8 分意味着几乎无法完成自主编码任务,62.7 分已进入主流 Agent 产品的竞争区间。
参照系:此前 V4-Flash 正式版(7 月 31 日)在 DeepSWE 上得分 54.4,V4-Pro 正式版的 62.7 比 Flash 还高出约 8 个百分点。
第三方 BenchLM 数据(V4 Pro High 模式):
| 类别 | 测试集 | 分数 |
|---|---|---|
| 编程 | SWE-bench Verified | 79.4% |
| 编程 | LiveCodeBench COT | 89.8% |
| 编程 | Codeforces Rating | 2919 |
| 推理 | GPQA Diamond | 89.1% |
| 长上下文 | MRCR 1M token | 83.3% |
| 智能体 | BrowseComp | 80.4% |
| 数学 | HMMT Feb 2026 | 94.0% |
| 数学 | IMOAnswerBench | 88.0% |
价格:3 倍于 V4-Flash,官方预告涨价
V4-Pro 维持预览版定价,与 V4-Flash 正式版的对比:
| 计费类型 | V4-Flash | V4-Pro | 倍数 |
|---|---|---|---|
| 输入(缓存未命中) | ¥1/M | ¥3/M | 3× |
| 输入(缓存命中) | ¥0.008/M | ¥0.025/M | ~3× |
| 输出 | ¥2/M | ¥6/M | 3× |
| 并发限制 | 2500 | 500 | 1/5 |
注意:官方文档在 V4-Pro 发布的同一天明确提示:“We plan to raise the overall pricing for DeepSeek API services in the near future, with asignificant increaseexpected.”
如果有大量 V4-Pro 调用计划,当前时间窗口锁定用量可能有意义。
API 接入方式变化:Responses API + Anthropic 双协议
V4-Pro 正式版新增了两个 API 协议层的兼容:
1. OpenAI Responses API(新)
fromopenaiimportOpenAI client=OpenAI(api_key="你的 DeepSeek Key",base_url="https://api.deepseek.com/v1",)response=client.responses.create(model="deepseek-v4-pro",input="分析这段代码并生成测试用例",)print(response.output_text)2. Anthropic API 协议(新)
importanthropic client=anthropic.Anthropic(api_key="你的 DeepSeek Key",base_url="https://api.deepseek.com",)message=client.messages.create(model="deepseek-v4-pro",max_tokens=4096,messages=[{"role":"user","content":"分析这段代码并生成测试用例"}],)print(message.content[0].text)3. 标准 OpenAI Chat Completions(不变)
原有 OpenAI 格式调用无需修改,model字段填deepseek-v4-pro即自动指向最新版本。
这意味着:现有 Claude Code、Codex 的工作流,可以通过切换 base_url 和 api_key 直接测试 V4-Pro 能力,代码零改动。
推理强度调节
V4-Pro 支持三档推理模式,通过reasoning_effort参数控制:
completion=client.chat.completions.create(model="deepseek-v4-pro",reasoning_effort="high",# "none" / "high" / "max"messages=[{"role":"user","content":"设计一个分布式任务队列的架构方案"}],)| 档位 | API 值 | 适用场景 | Token 消耗 |
|---|---|---|---|
| Non-Think | "none" | 快速问答、代码补全、格式转换 | 最少 |
| Think High | "high" | 代码审查、多步推理、调试 | 中 |
| Think Max | "max" | 复杂架构设计、竞赛题、长链路 Agent | 最多 |
企业生产环境建议按任务类型动态设置——简单任务用"none"可将成本和延迟降低 50% 以上。
V4-Pro vs V4-Flash:怎么选
两款模型现在同时在线,核心区别:
| 维度 | V4-Flash | V4-Pro |
|---|---|---|
| 参数量 | 284B MoE | 1.6T MoE |
| 激活参数 | ~13B | ~49B |
| 价格 | ¥1/¥2/M | ¥3/¥6/M |
| 并发限制 | 2500 | 500 |
| DeepSWE | 54.4 | 62.7 |
| NL2Repo | 54.2 | 61.5 |
| 适用场景 | 高并发、低延迟、成本敏感 | 复杂推理、多步 Agent、代码生成 |
选型建议:
- 代码生成、自主 Agent 任务 → V4-Pro(Agent 能力高 8–10 个百分点)
- 高并发 RAG、实时问答、批量处理 → V4-Flash(并发 5 倍,成本 1/3)
- 不确定的场景 → 先用 Flash 测出延迟和质量基线,再决定是否升级 Pro
配套:Harness 极简模式首次亮相
V4-Pro 发布文档中首次正式提及 DeepSeek Harness:
“正式版 DeepSeek-V4-Pro 使用DeepSeek Harness 极简模式(即将发布)作为 Agent 测试框架”
这意味着上述所有 Agent 基准(DeepSWE 62.7、NL2Repo 61.5 等)是在 Harness 极简模式下跑出来的。完整 Harness 产品包含更丰富的上下文管理、工具编排和测试回传闭环——实际 Agent 场景下的表现有望进一步提升。(DeepSeek Harness 的完整背景详见团队介绍。)
常见问题
Q:V4-Pro-0813 和之前的deepseek-v4-pro模型 ID 是什么关系?
无缝兼容。API 调用时使用deepseek-v4-pro即自动路由到最新正式版(0813),无需修改代码。0813 是版本号标识,API 层面透明。
Q:官方提示的"大幅涨价"是什么时候?
截至 2026 年 8 月 13 日,官方未给出具体涨价时间,仅说"near future"(近期)。建议关注官方 API 文档更新日志(api-docs.deepseek.com)。
Q:V4-Pro 的并发限制 500 对企业场景够用吗?
取决于请求量。500 并发对于大多数中型企业日常用量足够,但高并发批处理场景(如离线数据分析、大规模代码审查流水线)可能触顶,此时需要混合使用 V4-Flash 或通过多 Key 分流。通过多模型聚合 MaaS 平台(如七牛云 Token Plan,qiniu.com/ai/plan)统一接入 DeepSeek 和其他国产模型,可以在 V4-Pro 触达并发上限时自动降级到其他模型,降低业务中断风险。
Q:Anthropic API 格式接入 DeepSeek 会有行为差异吗?
接口层协议兼容,但 DeepSeek V4-Pro 的 thinking 模式与 Claude 的 extended thinking 实现不同,streaming 的reasoning_content字段格式也有差异。建议在迁移前测试关键提示词的输出一致性。
Q:DeepSWE 62.7 是什么水平?
DeepSWE 是 DeepSeek 的内部 Agent 基准,外部独立复现数据有限。作为参照:BenchLM 第三方数据显示 V4-Pro 在 SWE-bench Verified(业界通用基准)上得分 79.4%,处于同级别模型第一梯队,但仍低于 Claude Opus 5 的 96%。
小结
V4-Pro-0813 是一次重点在后训练的 Agent 能力升级:架构不变,DeepSWE 从 12.8 升至 62.7,Agent 编排能力从"几乎无法完成"跨越到"可与主流产品竞争";双协议支持(OpenAI + Anthropic)让现有 Claude Code / Codex 工作流可以零改动接入测试;价格维持 ¥3/¥6 per million token,但官方涨价预告已经发出,当前是锁定用量的时间窗口。
DeepSeek V4 系列至此首次形成完整正式版矩阵——Flash 负责高并发低延迟,Pro 负责复杂推理和深度 Agent,Harness 作为配套工程框架即将补位。
本文信息截至 2026 年 8 月 13 日,以 DeepSeek 官方 API 文档为准。
延伸阅读
- DeepSeek API 官方更新日志:https://api-docs.deepseek.com/zh-cn/updates
- DeepSeek API 价格页:https://api-docs.deepseek.com/quick_start/pricing
- BenchLM V4 Pro High 测评数据:https://benchlm.ai/models/deepseek-v4-pro-high
- 七牛云 Token Plan(含 DeepSeek V4 Pro 多模型接入):https://qiniu.com/ai/plan
