DeepSeek V4 Flash悄无声息炸场,Agent能力暴涨6倍,价格直接卷到地板
文章目录
- 1. 悄咪咪上线的狠角色
- 1.1 最炸裂的成绩:能力直接涨6倍
- 1.2 其他榜单也一路杀穿
- 1.3 最可怕的是:底座没动,全靠后天教育
- 2. 技术底座:硬实力本来就够打
- 2.1 基础参数拉满
- 2.2 三项核心技术撑场
- 2.3 长文本痛点直接打穿
- 3. 价格屠夫:真·白菜价
- 3.1 低到离谱的单价
- 3.2 缓存折扣才是隐藏杀招
- 4. 生态已经动起来了
- 4.1 大厂第一时间接入
- 4.2 开发者社区已经玩出花
- 5. 到底谁该用这个模型
- 5.1 Flash的适用场景
- 5.2 真正的王炸还在后面
P.S. 目前国内还是很缺AI人才的,希望更多人能真正加入到AI行业,共同促进行业进步,增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 http://blog.csdn.net/jiangjunshow,教程通俗易懂,高中生都能看懂,还有各种段子风趣幽默,从深度学习基础原理到各领域实战应用都有讲解,我22年的AI积累全在里面了。注意,教程仅限真正想入门AI的朋友,否则看看零散的博文就够了。
1. 悄咪咪上线的狠角色
这年头大厂发新模型,标配都是开发布会、上热搜、KOL齐转发。
恨不得提前半个月就把悬念拉满,生怕没人知道。
结果DeepSeek倒好,7月31号下午,悄咪咪在API文档里更了一行日志。
V4 Flash正式版,就这么上线公测了。
连个预热推文都没有,低调得像上班摸鱼改需求的程序员。
不知道的还以为是偷偷修复bug,结果是放了个王炸。
1.1 最炸裂的成绩:能力直接涨6倍
先给大家上硬数据。
正式版跟预览版比,模型结构、参数规模完全没动。总参数2840亿,激活参数130亿,底层基座原封不动。
就做了一轮后训练优化,Agent能力直接实现质的飞跃。
最夸张的是DeepSWE基准测试,专门考AI Agent真实长周期多步骤编程的。
预览版才7.3分,正式版直接干到54.4分,暴涨超过6倍。
什么概念?上次考试考7分的中等生,三个月后冲到54分。
还不是靠抄答案,是真的会解复杂大题了,步骤还不带错的。
1.2 其他榜单也一路杀穿
不光是这一项,其他基准测试成绩全线飘红。
Terminal Bench 2.1拿了82.7分,比自家V4 Pro预览版高,也超过了GLM‑5.2,离Opus‑4.8的85分只差一线。
海外机构的智能指数测试,最高档位拿到50分。
比四月份的V4 Flash高10分,比V4 Pro高6分,离GPT‑5.6 Luna的最高分只差1分。
就这表现,谁能想到是个主打廉价的模型跑出来的。
相当于千元机跑出旗舰机的跑分,离大谱。
1.3 最可怕的是:底座没动,全靠后天教育
这次升级最吓人的,不是分数高,是分数怎么来的。
基座一点没改,就靠更精细的后训练策略,两阶段范式练了一遍。
相当于同一个学生,没换脑子没换智商,就换了套复习方法,直接从及格线冲进尖子生行列。
别人提分靠堆参数、换架构,相当于换个更聪明的脑袋。
DeepSeek提分靠刷题、讲方法,把同一个脑袋的潜力挖到底。
这说明什么?后训练的优化空间,比所有人想象的都大得多。
那这套方法平移到Pro版上,效果还不得炸上天?也难怪官方说Pro正式版会尽快发。
2. 技术底座:硬实力本来就够打
能有这个表现,底子本来就不差。
2.1 基础参数拉满
上下文长度100万token,最大输出384K tokens。
支持切换思考/非思考模式,原生支持Responses API格式,代码场景做了专项适配。
接口还同时兼容OpenAI和Anthropic格式,上手零成本,换个密钥就能用。
对开发者来说,等于不用改代码,直接白嫖性能升级。
2.2 三项核心技术撑场
第一项是混合注意力架构。
传统注意力看长文本,字越多算得越慢,复杂度平方级上涨。
这套架构就是,强关联的内容精读,弱关联的压缩跳过,直接突破了长文本的算力瓶颈。
说白了就是看书抓重点,没用的一扫而过,有用的仔细琢磨,效率自然高。
第二项是流形约束超连接。
解决模型叠深了数值不稳的问题,训练稳定性提升6.7%,叠再深也不塌。
第三项是Muon优化器,全链路推理加速最高接近2倍,跑起来又快又省。
2.3 长文本痛点直接打穿
实际效果有多夸张?
100万token场景下,单token推理算力只有V3.2的10%,KV缓存占用只有7%。
以前长文本跑不动、记不住、用不起的老三样问题,直接全给解决了。
以前处理百万字文档得等半天还烧钱,现在又快又便宜,跟喝白开水似的。
3. 价格屠夫:真·白菜价
性能卷完了,接下来就是价格,这才是DeepSeek的传统艺能。
3.1 低到离谱的单价
先看价格表:平时缓存命中的输入,0.02元一百万token。
算笔账,处理一篇10万字的文章,成本不到1分钱。
有媒体测算,这价格大概是Claude的九十分之一。
以前用大模型处理长文档,得攥着预算精打细算,生怕超支。
现在?随便造,敞开用,跑一天可能都花不了一杯蜜雪冰城的钱。
3.2 缓存折扣才是隐藏杀招
更狠的是缓存策略。
别家缓存命中折扣大多90%,DeepSeek直接干到98%,命中和未命中输入价差50倍。
有开发者实测,重构完缓存策略,单次请求成本从1.2元降到0.17元,直接砍掉85%。
相当于平时喝20块的奶茶,突然变成3块钱一杯,还天天有这价。
对高频调用的Agent工作流、RAG应用、批量生成场景来说,这成本基本等于可以忽略不计。
企业级AI能力的门槛,直接被压到了地板上,还带摩擦的那种。
4. 生态已经动起来了
正式版刚上线,行业反应比谁都快。
4.1 大厂第一时间接入
网易有道直接宣布旗下AI Agent产品矩阵全面接入。
办公助手、词典、翻译、同传、答疑笔,连企业级大模型聚合平台都全覆盖了。
嗅觉是真的灵敏,好处先占上再说,晚一步都怕亏了。
4.2 开发者社区已经玩出花
Codex代码场景专项适配完,配合原生Responses API,写代码调用又顺又准。
社区里已经有人拿它搭配Claude Code做终端原生编程Agent,速度快得离谱。
开源社区的创造力,永远比你想的快一步。
价格打下来了,玩法自然就多了,毕竟谁不爱便宜又好用的东西。
5. 到底谁该用这个模型
最后说点实用的,给大家捋清楚选型逻辑,别瞎选浪费钱。
5.1 Flash的适用场景
一句话总结V4双版本定位:重推理、长文档、复杂自动化任务选Pro;高并发、低成本、批量轻任务选Flash。
简单Agent任务上,Flash正式版跟Pro已经旗鼓相当。
日常问答、内容生成、轻中度代码开发、高频Agent步骤、批量数据处理,还有对成本敏感的产品功能,选Flash就对了。
中文写作还尤其自然,日常用完全够用,性价比拉满。
5.2 真正的王炸还在后面
特意提一句,这次升级的只有V4‑Flash的API。
V4‑Pro的API还有APP、网页端都没动,正式版还在路上。
现在的Flash就已经这么能打了,等Pro正式版用上同款后训练优化,那才是真正的炸场时刻。
现在只是开胃小菜,大菜还在后头呢。
最后说两句。
DeepSeek的路子一直很明确:拿不到顶级芯片,就靠工程优化把价格炸穿地板。
不盲目堆参数,就把每一分算力、每一分钱都用到极致。
当百万上下文、130亿激活参数、白菜价、接近顶级的Agent能力凑到同一款模型上的时候。
行业的价格体系,怕是又要重新洗牌了。
P.S. 目前国内还是很缺AI人才的,希望更多人能真正加入到AI行业,共同促进行业进步,增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 http://blog.csdn.net/jiangjunshow,教程通俗易懂,高中生都能看懂,还有各种段子风趣幽默,从深度学习基础原理到各领域实战应用都有讲解,我22年的AI积累全在里面了。注意,教程仅限真正想入门AI的朋友,否则看看零散的博文就够了。
