当前位置: 首页 > news >正文

DeepSeek V4 Pro 正式版来了:DeepSWE 暴涨近 5 倍,Codex 一条命令直连

大家好,我是老张。

先问个扎心的问题:你让 AI 写代码的时候,它到底是在"干活",还是在"表演干活"?

老张自己的体验是,很多模型聊天挺溜,一让它改个真实仓库、跑个完整流程,就开始露馅——不是漏了边界条件,就是把接口参数搞错,最后还得自己吭哧吭哧修到凌晨。

所以判断一个 Agent 强不强,别听它吹,得看它在真实软件工程基准上的分数。今天 DeepSeek V4 Pro 正式版上线,恰好最值得看的就是这块。


一、发生了什么

一句话:deepseek-v4-pro 模型版本更新为 DeepSeek-V4-Pro-0813,调用方式完全不变。

对,还是那个模型名 deepseek-v4-pro,你的代码一行不用改,就能自动用上最新版本。老张最烦的就是换个版本还得改一堆配置,这次官方干得挺利索。

顺带说一句,deepseek-v4-flash 也更新到了 DeepSeek-V4-Flash-0731,同样调用不变。之前 Flash 正式版上线时老张聊过它原生支持 Codex,这次 Pro 也跟上了。


二、性能到底涨了多少

别的不扯,直接上官方 Agent 基准测试的数(DeepSeek-V4-Pro-0813 vs 预览版):

基准 得分 变化
Terminal Bench 2.1 87.9 较预览版提升
Cybergym 83.3 超越 Claude Fable 5
Toolathlon-Verified 74.1 较预览版提升
DSBench-FullStack 71.1 较预览版提升
DeepSWE 62.7 预览版仅 12.8,涨近 5 倍
NL2Repo 61.5 较预览版提升
AutomationBench (Public) 超越 Claude Fable 5

最扎眼的是 DeepSWE——这是个考验"长周期、高复杂度真实软件工程"的基准,预览版只有 12.8 分,正式版直接干到 62.7,涨了近 5 倍。这个数字意味着它不是"会做选择题",而是真的能在复杂代码仓库里把活干完。

另一个信号是,在 Cybergym(安全智能体)和 AutomationBench(工作流智能体)上,V4 Pro 正式版的表现直接超过了 Claude 对标旗舰 Fable 5。

对运维和开发者来说,还多了几个实用的能力:支持 JSON 结构化输出、工具调用、Responses API 和 Anthropic API 格式。换句话说,你能用它接更多现成的 Agent 框架和工具链。

老张提醒一句:基准测试反映的是特定评测设置下的表现,实际效果还看任务类型、提示词和推理预算。分数是参考,不是承诺。


三、Pro 原生支持 Codex 了

这是老张觉得最实在的一点。

以前给 Codex 接国产模型,最大的坎是协议不兼容——Codex 走 OpenAI 的 Responses API,国产模型走 Chat Completions,两套东西对不上,你直接改 Base URL 大概率报 404,得在本机跑一层代理做协议翻译,麻烦不说还容易踩坑。

现在 DeepSeek V4 Pro 官方原生支持了 Responses API,意味着 Codex 可以直连 DeepSeek,中间那层代理可以省了。

官方直接给了一键脚本 codex-deepseek-setup.sh。跑起来之后是个菜单,现在你能看到:

Codex DeepSeek Setup v1.1.0
Codex 目录: /Users/xxx/.codex
请选择要执行的操作:
1. 修改 Codex 配置,使用 deepseek-v4-flash 模型
2. 修改 Codex 配置,使用 deepseek-v4-pro 模型
3. 恢复默认的 Codex 配置(删除 deepseek 相关配置)

注意选项 2——deepseek-v4-pro 已经能选了。在这之前,官方文档里明确写着"当前只有 Flash 支持 Codex,Pro 预计 8 月初支持",现在这个"预计"落地了。

脚本会帮你写好 ~/.codex/models.jsonconfig.toml,输入 API Key 回车就行。想切换模型再跑一遍,想还原选 3。脚本地址在 DeepSeek 官方文档的「Agent 工具接入指南」里,直接去复制即可。

老张实测建议:跑之前先确认 Codex CLI 或桌面端至少启动过一次,让它生成好 ~/.codex 目录;另外脚本会动你的 config.toml,如果你原来配过 plugins、MCP 或项目信任,记得先备份一下。


四、老张怎么看

几点实话:

1. 这次更新最值钱的不是跑分,是落地。
DeepSWE 涨近 5 倍 + 原生 Codex,说明 DeepSeek 在"让 Agent 真干活"这条路上是动真格的,不是刷个 MMLU 就完事。

2. 免中转代理,省的是维护成本。
少一层代理,就少一个会挂的环节。对个人和小团队来说,这事儿的价值不亚于模型变聪明。

3. 价格还没定,别急着下结论。
官方目前还没公布 V4 Pro 的 API 定价,此前也预告过近期会整体调整定价。想上生产的,建议先关注官方正式通知,别拿现在的价格当长期承诺。

4. 网页端和 API 端有差异的反馈。
社区里有网友提到网页端和 API 调用出来的思维链表现有差异,API 输出的话术偏生硬。如果你觉得 API 效果不对劲,可以留意下这个点,等官方后续优化。


五、适合谁用

场景 推荐程度
用 Codex 写代码、想换国产模型的 ⭐⭐⭐⭐⭐
搞 Agent 自动化、工具调用的开发者 ⭐⭐⭐⭐⭐
对成本敏感的中小团队 ⭐⭐⭐⭐
需要极低延迟的实时交互场景 ⭐⭐⭐(并发上限 500,低于 Flash 的 2500)

六、资源

  • DeepSeek API 文档(首次调用):https://api-docs.deepseek.com/zh-cn/
  • Codex 接入指南:https://api-docs.deepseek.com/quick_start/agent_integrations/codex
  • 更新日志:https://api-docs.deepseek.com/zh-cn/updates

聊聊你的方案

评论区见:

  1. 你现在写代码用哪个模型当主力? DeepSeek、还是别的?
  2. 给 Codex 接国产模型,你踩过协议不兼容的坑吗?
  3. 如果 AI 能再帮你干一件事,你最希望是什么?

老张先说:我挺期待 DeepSWE 这种"真实工程"基准以后能更普及——跑分吹得再响,都不如看它能不能把一个真实仓库从头改到尾。

你怎么看?留言区聊聊。

http://www.jsqmd.com/news/1384017/

相关文章:

  • Vue Router滚动位置缓存:从原理到实战的完整解决方案
  • AI服务器PCB基材选型,为什么贵?
  • 【careUeye】截图的时候区域发黄的问题怎么解决
  • Unity游戏翻译神器XUnity.AutoTranslator:5分钟快速上手指南
  • MySQL锁机制深度解析:从原理到实战排查死锁与性能优化
  • 2026年工程机械分动箱专业制造商:镇江市金鼎变速箱有限公司 - 卓企推荐
  • SQL Server 2019安装全攻略:从环境准备到故障排除
  • 猫抓cat-catch:浏览器媒体嗅探架构深度解析与性能优化实战
  • BetterGenshinImpact完整指南:免费自动化工具彻底解放你的原神游戏时间
  • 【开发工具与学习】Visual Studio 和 VSCode 哪个好?
  • AI服务器PCB叠层与过孔设计全解析
  • 顺丰同城:专业可靠即时配送,全力保障准点履约 - 服务品牌热点
  • 上海代理记账公司怎么选?附避坑指南 - 财税推荐官
  • Flutter应用安全实战:剖析资源滥用型病毒与全链路防御方案
  • AI Game Generator 是什么?从一句 Prompt 到可玩游戏的完整流程
  • 烟台本地家装怎么选|烟台智云装饰有限公司综合服务介绍 - 收录优先
  • SeedRealtime:原生全双工多模态大模型实战指南
  • 小天互连企业即时通讯选型 100人以上组织应按3年TCO比较 - 小天互连即时通讯
  • CK2双字节补丁:解决十字军之王II亚洲语言显示难题的完整方案
  • AI Agent共享记忆系统构建:基于向量数据库与语义检索的上下文管理实践
  • 《波比的游戏时间》原型体1006:恐怖游戏终极Boss设计与叙事解析
  • (一)Linux 目录结构 + 基础命令
  • XSign:本地化IPA签名工具,一键批量处理iOS应用
  • AI服务器PCB电源完整性PDN设计解析
  • Java 21虚拟线程在RAG平台中的实践:从响应式到同步的性能优化
  • TileRT:NVIDIA GPU大模型推理性能优化的内核级技术解析
  • 如何用d2s-editor彻底告别暗黑2存档修改的复杂操作:5个简单技巧让游戏体验翻倍
  • AI辅助数学研究实战:基于Claude构建黎曼ζ函数零点搜索系统
  • 数据结构与算法:时间复杂度与空间复杂度实战解析
  • JMeter元件深度解析:从脚本录制到性能洞察的进阶指南