当前位置: 首页 > news >正文

DeepSeek V4 Flash 0731 正式版实测:20轮小说、Responses Agent 与四档思考

摘要

DeepSeek-V4-Flash-0731 正式版 API 已上线公测,稳定调用名仍是deepseek-v4-flash。我用旧版同题 20 轮长篇、原创 12 轮链、两张 RP 卡、四题材写卡和 Responses 工具闭环重跑了一遍。结论不是简单的“全面升级”:0731 明显减少跨轮复读、Agent 工具可用,但原著文风距离变大;在 8192 token 输出上限下,high/max 还可能把额度全部耗在 reasoning,正文为 0。把上限放到 32K 后,同一批 max 任务可以完整结束。


7 月 31 日,DeepSeek 官方更新日志写的是:DeepSeek-V4-Flash 正式版 API 上线公测

这句话有四个边界:

  • API 调用名仍是deepseek-v4-flashDeepSeek-V4-Flash-0731是当前版本名,不是请求时要填写的新 ID。
  • 0731 与 Preview 的架构、尺寸相同,本次变化是重新后训练。
  • 这次只更新 Flash API;V4 Pro API、App 和 Web 模型没有同步切换。
  • “正式版上线公测”不是全面 GA。

我先请求官方/v1/models,HTTP 200,目录同时列出deepseek-v4-flashdeepseek-v4-pro。随后才开始生成测试。

先给结论

场景发布日结果当前建议
Chat SSE200,正常终止可用
Responses SSE200,正常终止可用
Responses Agent 工具两步闭环auto下 200/200可用,但不要强制required
旧考卷 20 轮长篇20/20 完成少复读,但文风与事实并非单边升级
原创长篇 · none / low · 8K两档均 12/12 完成none 更快、更便宜
原创长篇 · high / max · 8Khigh 首轮空正文;max 第 4 轮空正文8K 不够
max · 32K 续写完成,706 字符32K 本轮够用
max · 16K 四题材写卡只写出第 1 张卡开头失败
max · 32K 四题材写卡四卡全部完成能完成,但篇幅仍偏长

官方价格

英文价格页当日牌价,单位均为每 100 万 token:

计费项美元
输入 · 缓存命中$0.0028
输入 · 缓存未命中$0.14
输出(含 reasoning)$0.28

中文价格页对应列为 0.02 元、1 元、2 元。本文成本统一按英文页美元牌价计算,不把它描述成汇率换算。

官方还预告未来高峰时段可能按 2 倍计价,高峰为北京时间 09:00–12:00、14:00–18:00;但生效时间仍写“以正式通知为准”。因此本文没有把 2 倍价格当作已经执行。

协议与 Agent:有一个真实 400

Chat max SSE 用时 1.82 秒,输出正确;118 输入 token、43 输出 token,其中 35 个 reasoning token。

Responses max SSE 用时 1.71 秒,输出正确;111 输入、19 输出,其中 9 个 reasoning token。

Agent 工具测试使用 Responses 的无状态两步方式:

  1. 第一步让模型调用函数工具。
  2. 客户端执行工具。
  3. 第二次请求显式重放 reasoning 与 function call,再附上function_call_output

tool_choice=auto时两步均为 200,最终答案正确,第二步还命中 512 个缓存 token。

thinking=max + tool_choice=required在发布日真实返回 400:

Thinking mode does not support this tool_choice

所以当前 Agent 路由不能把“必须调用工具”机械翻译成required。在 thinking 模式下,用auto配合明确提示词可以走通。这个负例也解释了为什么“模型支持工具”不等于所有 OpenAI 参数组合都兼容。

20 轮旧考卷:少复读了,文风却更远了

这条轨复用旧 M69 长篇脚本:同一本中文玄幻、同一 55% 起点、同一 21,500 字符滚动窗口、同一 B2 提示词、温度字段 0.7、max_tokens=2800、思考档省略。历史链来自 0731 上线前;新链直连官方稳定 ID。

指标历史 Preview 链0731 正式版链
完成轮数20/2020/20
可见正文总字符6,5148,761
每轮平均字符325.7438.1
80–220 字符合要求1/201/20
跨轮 12-gram 最坏重叠72.0%1.2%
与原著结构画像距离(越低越贴)0.3560.550

0731 的进步很具体:旧链第 14 轮与此前内容出现 72% 的机械重叠,新链最坏只有 1.2%,20 轮全部唯一,没有来源标记泄漏。

退步也很具体:正文更长,三轮超过 500 字符、两轮超过 1,000;结构画像离原著更远。两套映射翻转盲评最终 1:1:

  • 一位评审判 Preview 窄胜,理由是文风、事实稳定和长度控制更好。
  • 另一位评审判 0731 小胜,理由是推进更强、倒带和模板复演更少。

两位评审其实在描述同一件事:0731 更愿意往前写,但更容易写成自己的长段落,并临时改动人物或规则。这不是“全面提升 X%”,而是一组取舍。

新链 20 轮共输入 281,313 token、输出 22,764,其中 reasoning 16,625,占输出 73.03%。中位耗时 14.31 秒/轮,总成本约 $0.04513。

四档思考:8K 下 none/low 能跑,high/max 会空

原创公开考卷《潮痕档案》要求每轮 450–700 字符,连续写 12 轮,窗口仍为 21,500 字符。四档都使用同一题面与 8,192 output token 上限。

effort完成首正文中位单轮总耗时中位正文字符中位reasoning 合计成本
none12/120.75s11.12s9210$0.00464
low12/127.06s22.62s1,3036,179$0.00745
high0/1无正文109.53s08,191$0.00252
max前 3 轮有正文,第 4 轮中断第 4 轮 8,189$0.00755

none 与 low 都跑满,但长度控制都不合格:两档均为 0/12 落入 450–700 字符,low 反而更长。快速抽读还看到正文自我纠错和时间线硬填,因此“接口完成”不能替代质量判断。

high/max 的失败则非常明确:HTTP 仍是 200,但 output budget 被 reasoning 用完,终止态是incomplete/length,正文为 0。

不是官方只给 8K,是应用侧上限太旧

DeepSeek 并没有把 V4 Flash 正式版限制在 8K 输出。本轮 8K 是应用常见的请求包络。

我们随后只改一个变量,把 max 档输出上限放到 32,768:

32K 定点 case结果reasoning可见正文总耗时成本
原创续写首轮completed6,806706 字符106.1s$0.00206
四题材角色卡completed,四卡齐全12,4425,852 字符206.9s$0.00466

32K 足以让两条此前被截断的 max 任务完整结束,没必要直接冲到 64K。四张卡虽然齐全,四个开场仍都超过题面 700–1,000 字符,所以这是“解除截断”,不是“质量全绿”。

这也给应用开发一个明确修复方向:

  • 不要对所有模型统一硬截 8K。
  • 计费预扣仍要保留,但上限应按模型和 reasoning 档分级。
  • DeepSeek V4 Flash 的 none/low 可继续用 8K;high/max 至少应给到本轮验证过的 32K。
  • UI 的“关闭思考”必须真的发送 Responsesnone或 Chatthinking=disabled。如果只是“不传参数”,DeepSeek 会回到默认 high,并不是真的关闭。

RP 与写卡:接口成功不代表事实稳定

两张角色卡各 4 轮 RP,共 8/8 完成,长度也都落在 180–350 字符。但人工快检发现三类硬问题:

  • 为化解公开母亲录音的伦理质疑,临时编出题面没有的许可式原话。
  • 便利店人数直接写错。
  • 02 点场景突然跳到 11:59。

因此 RP 的结论是“API 与长度闸通过,事实纪律仍需模型或提示词层修复”。

四题材写卡在 16K max 档下用了约 16.2K reasoning,只剩 255 字正文,仅写出第一张卡开头;32K 后四卡齐全。这个 case 很适合当生产回归:一旦服务端又把 DS high/max 压回 8K/16K,它会立刻红。

缓存与总费用

不同请求形态的缓存差异很大:

  • Agent 工具第二步:命中 512 token。
  • M69 20 轮旧考卷:只命中 4,608 / 281,313 输入 token,约 1.64%。
  • 原创 none/low 12 轮:分别命中约 77.35% / 78.00%。
  • 所有 Responses 内容调用的cache_write_tokens都是null;官方 usage 只明确提供命中 token,不应虚构“写缓存 token”。

本轮所有官方调用合计估算 $0.07994。按1 credit = $0.0001直接换算、总额一次向上取整是 800 credits;若像应用账本一样每个请求分别向上取整,约 832 credits。这里是上游成本等价,不包含应用可能设置的服务加价。

最后结论

DeepSeek-V4-Flash-0731 的 API 确实已上线,Chat、Responses、缓存和 Responses Agent 工具闭环都能工作。与 Preview 同题相比,它的长篇机械复读大幅下降,但文风距离、事实稳定和长度服从没有同步变好。

对应用开发者,发布日最重要的不是“换模型 ID”,而是三件事:

  1. 调用名继续用deepseek-v4-flash
  2. thinking Agent 用tool_choice=auto,不要在当前版本强制required
  3. high/max 不要再给统一 8K;32K 是本轮已经验证能解除截断的起点。若想真正关闭思考,必须显式传none/thinking=disabled

样本边界也写清:20 轮对比只有单书、单起点、单链;原创努力档也是每档一条链,不足以做统计显著的通用排行榜。本文能证明的是发布日端点的真实行为和几个稳定复现的工程风险。

官方资料

  • DeepSeek 2026-07-31 更新日志:https://api-docs.deepseek.com/zh-cn/updates/#时间-2026-07-31
  • 模型与价格:https://api-docs.deepseek.com/zh-cn/quick_start/pricing/
  • 思考模式:https://api-docs.deepseek.com/zh-cn/guides/thinking_mode/
  • Responses API:https://api-docs.deepseek.com/zh-cn/guides/responses_api/

标签

DeepSeek-V4-Flash/DeepSeek V4/Responses API/Agent/大模型评测/AI 写作

http://www.jsqmd.com/news/1306003/

相关文章:

  • 2026年广东包装内衬海绵OEM工厂推荐:选兴顺兴的三大硬核理由 - 变量人生001
  • 2026年植物支撑杆厂家推荐榜单:花架支撑杆/蔬菜爬藤架/包塑钢管支撑杆,番茄黄瓜豆角葡萄月季通用,稳固防腐户外庭院阳台优选 - 优企名品
  • 阅读笔记:Ocean-OCR:Towards General OCR Application via a Vision-Language Model
  • 番禺家装量身定制怎么选
  • 5分钟快速找回QQ空间全部历史说说的完整指南:GetQzonehistory让青春记忆永不丢失
  • 2026年嘉兴市新时代包装彩印有限公司绿色环保印刷全景白皮书 - 招财兔数字员工
  • 2026年成都代理记账费用是怎样的,受哪些因素影响? - 企业推荐官
  • PotPlayer字幕翻译插件:5分钟实现免费双语观影体验
  • 深入理解javac:从命令行编译到Java项目构建的核心原理与实践
  • Clean disk C
  • 身边同学都拿到大厂 Offer 焦虑爆棚?用信息屏蔽与自我节奏破局「蒸汽求职分享」
  • 深耕青岛本地防水修缮,匠心解决各类建筑渗漏难题 - 国麟测评
  • 娄底市屋顶漏水维修_2026湖南中部湘中明珠漏水维修价格行情与哪家好 - 雨婺虹房屋维修
  • 2026年阿克苏地区AIGC应用工程师怎么报名?中山优才教育报考指南 - 人工智能报名机构推荐
  • 嵌入式C++写了五年,被告知“算力被卡脖子“,结果成了AI边缘部署最稀缺的人
  • OpenCode 速通:19 万星,自主操控浏览器干活
  • 三步解决音乐平台锁定:用Unlock Music Electron重获你的音乐自由
  • 基于北斗NTP网络时间同步服务器的局域网时间同步解决方案
  • 一元二次不定式求整数解
  • Unity UIBuilder可视化UI开发:从界面搭建到脚本交互全流程
  • 硬盘损坏 数据打不开不要慌
  • MIT 6.S081 Lab 7:xv6内核多线程与同步原语实现详解
  • CRC-16 CCITT校验算法详解:原理、实现与嵌入式通信实战
  • 2026年PE保护膜厂家推荐排行榜,蓝色防静电PE膜,透明防水pe保护膜,耐高温防刮花pet保护膜源头厂商推荐! - 优企名品
  • XUnity.AutoTranslator终极指南:3分钟实现Unity游戏实时汉化
  • 【AI副业品牌溢价密码】:为什么同样用ChatGPT接单,有人客单价翻5倍?——头部17位AI服务商的品牌资产拆解报告
  • 本体论从入门到实战-13.本体构建者的实战指南-通用本体
  • 旺苍县房屋漏水渗水维修实用建议,专业公司现场检测,精准定位漏点再施工 - 同城资讯
  • 2026年必看!成都资深人士力荐的那些宝藏GEO公司究竟啥样? - 企业推荐官
  • Matlab文件类型全解析:从.m/.mlx到.mat/.fig/.p,掌握高效工作流