当前位置: 首页 > news >正文

别再迷信“参数越大越聪明“

别再迷信"参数越大越聪明"

同一个 DeepSeek 模型,只重做了一遍"后天教育",Agent 能力暴涨 6 倍,价格只剩闭源巨头的 1/90。


7 月 31 日晚上,DeepSeek 悄悄把 V4-Flash 的正式版 API 端了上来。

没有新模型发布,没有新架构论文,甚至连新闻稿都短得可怜。官方只说了两句话:模型结构和尺寸跟预览版完全一致,只重新做了一遍后训练。

结果 benchmark 一出来,圈子里炸锅了。

用来测 AI Agent 真实长周期编程能力的 DeepSWE,V4-Flash 从预览版的 7.3 分直接飙到 54.4 分。这不是小进步,是六倍多的跳涨。Terminal Bench 2.1 干到 82.7,逼近 Claude Opus 4.8 的 85.0;在 Artificial Analysis 的智能指数榜上拿了 50 分,而同类可比模型的中位数只有 17。

更扎眼的是价格:输入 0.14 美元、输出 0.28 美元每百万 token,缓存命中时只要 0.02 元每百万 token。Claude Opus 5 的定价是 5/25 美元,GPT-5.6 Sol 是 5/30 美元。粗算下来,DeepSeek 的价格大约是人家的 1/90。

同一个模型骨架,没换脑子,只换了个"补习班",成绩从二本冲到清北。

“后训练"听起来很技术,你可以把它理解成"毕业后的在职培训”:模型先在预训练里读完互联网上的海量书本和代码,相当于念完大学;后训练再教它怎么打电话、怎么查资料、怎么写报告、怎么跟客户沟通。大学文凭只能证明你学过,能不能干活,靠的是后面这套训练。

这不是神话,这是信号。

01 数据先说话:后训练到底能带来什么

我先把关键数字摊开来。

DeepSeek-V4-Flash-0731 的参数没动:总参数量 2840 亿,激活参数 130 亿,MoE 架构,100 万 token 上下文,支持思考/非思考双模式。真正变了的是"后天"——后训练策略。

效果有多夸张?

DeepSWE 从 7.3 涨到 54.4,涨了 6 倍多。DeepSWE 是专门用来测 Agent 在真实、长周期、多步骤编程任务里自主解决能力的基准。这个分数一跳,说明模型不再只是"会写代码",而是开始"能自己规划、自己找 bug、自己跑通一个项目"。

Terminal Bench 2.1 从 72.1 涨到 82.7,超过 GLM-5.2 的 81.0,逼近 Opus 4.8。这个测试看的是 Agent 在 Linux 终端里自主规划、执行多步命令、犯错后恢复的能力。说白了,就是"你给它一个服务器账号,它能不能自己把活干完"。

其他几项也不差:DSBench-FullStack 68.7,Cybergym 76.7,Toolathlon verified 70.3。AI 评测机构 Artificial Analysis 给它的综合智能指数打了 50 分,GPT-5.6 Luna 是 51 分,仅差 1 分。在 Arena.ai 的前端代码竞技场里,V4-Flash-High 以 1586 分登榜,比预览版高出 154 分。

还有一个容易被忽略的细节:它支持 100 万 token 的上下文窗口。Agent 干活时要读大量文档、代码库和历史记录,上下文越长,它越能"记住"整个项目,而不是每次都得重新补课。

这里最反直觉的是:GPT-5.6 Luna 是 OpenAI 花了大价钱、大算力训练出来的旗舰;而 DeepSeek 用同一副骨架,靠后训练就追到了身后一步。

价格更是让人坐不住。V4-Flash 输入 0.14 美元/百万 token,输出 0.28 美元/百万 token。对比 Claude Opus 5 的 5/25 美元,DeepSeek 不到它的 1/90。即便 OpenAI 在 7 月 30 日把 Luna 的价格猛砍 80%,DeepSeek 的单任务成本仍然比它低约 60%。

而且 DeepSeek 的缓存命中折扣高达 98%,业内普遍只有 90%。你反复调用同一段上下文时,它几乎不收钱。

这不是简单的"便宜",是把"单位有用结果"的价格打下来了。

02 预训练是基因,后训练是教育

很多人对大模型的理解还停留在"参数越多越聪明"。

这个逻辑以前没问题。GPT-3 到 GPT-4,参数翻几十倍,能力确实跨了一个台阶。那段时间,所有人都在堆数据、堆算力、堆参数。万亿参数成了口头禅,仿佛谁的模型大,谁就赢。

但今年以来,这条路的边际收益在明显递减。

从 GPT-3 到 GPT-4,算力涨了几十倍,能力提升也肉眼可见。但再往后,每多烧一亿美元训练出来的改进,正在变得越来越小。行业内部早就在传:继续堆参数、堆数据,训练成本指数级上升,但考试分数的提升可能只有几个点。这不是说预训练没价值,而是说它的"性价比"在下滑。

预训练本质上是在给模型"喂知识":海量互联网文本、代码、论文,让它学会语言规律和事实关联。你可以把它理解成"基因"——决定了这个模型的智商上限、知识储备、语言天赋。

但基因好不等于会干活。

一个智商 140 的孩子,没经过训练,也未必能写出好文章、解出竞赛题、谈下客户。真正把知识变成手艺的,是教育:怎么思考、怎么调用工具、怎么纠错、怎么在复杂任务里不跑偏。

后训练就是这个"教育"阶段。

它包括监督微调(SFT)、强化学习(RLHF)、工具调用训练、多轮任务规划训练,以及针对 Agent 工作流的专项优化。简单说,预训练让模型"知道",后训练让模型"做到"。

最近半年还有一个明显趋势:推理阶段的计算越来越重要。OpenAI 的 o 系列、DeepSeek 的思考模式,都是让模型在回答前多"想一会儿"。这个"想一会儿"不是预训练能解决的,它靠的就是后训练里教的推理策略。换句话说,以前大家比谁读书多,现在比谁更会思考。

过去两年,行业把 90% 的注意力放在预训练上。现在风向变了。DeepSeek 这次用行动证明:同一副骨架,只要把后训练做深做细,Agent 能力可以提升六倍以上,而且成本可以压到原来的零头。

这就像两个同样聪明的孩子,一个上了普通公立,一个进了顶级竞赛班。三年后,差距不是智商差距,是训练方法差距。

更深层地看,后训练崛起有一个产业背景:模型基座正在快速"基础设施化"。开源模型、蒸馏模型、MoE 架构已经把"好基因"的成本拉得很低。DeepSeek、Qwen、GLM、Kimi 的基座能力越来越接近,差距从代际缩短到个位数。

当大家基因差不多的时候,比的就是谁更会"教育"模型。

03 OpenAI 被迫降价 80%,价格战进入下半场

DeepSeek V4-Flash 上线的前一晚,OpenAI 做了一件罕见的事:把 GPT-5.6 Luna 的价格下调 80%。

这不是慈善。这是被价格战逼的。

今年以来,AI 圈的叙事已经从"谁能训练出更大的模型"转向"谁能用更低的成本交付有用的结果"。DeepSeek 擅长把后者做到极致。它用兼容 OpenAI Responses API 的策略,让开发者几乎可以零成本地把原本为 OpenAI 设计的 Agent 工作流迁移过来。切换成本几乎为零,价格却只有几分之一。

对开发者来说,这相当于同一条路,突然之间过路费从 90 块降到 1 块。

OpenAI 的应对是"降价清场"——把 Luna 降到原来的两折,试图用价格守住生态。但 DeepSeek 的缓存折扣和 API 兼容策略让它仍有成本优势。这不是单次降价能解决的。

为什么这次价格战这么狠?

因为 Agent 时代的商业模式变了。以前大模型主要卖"聊天":你问一句,它答一句,按 token 计费。现在 Agent 要调用搜索、读文档、跑代码、查数据库、发邮件,一个任务可能要几十轮推理和工具调用。token 消耗量是以前的十倍甚至百倍。

如果推理成本不降,Agent 就是玩具。只有把"完成一件事"的成本压下来,Agent 才能进企业、进工作流、进真实业务。

价格下降已经在改变产品形态。网易有道在 V4-Flash 上线当天就宣布全线产品完成接入,覆盖词典、翻译、同传、AI 答疑笔和办公助手 LobsterAI。对这类高频调用场景来说,token 成本每降一个数量级,产品里能放的功能就多一个数量级。

对个人开发者和"一人公司"来说,这更是一剂强心针。以前搭一个 AI 工具,最大的不确定因素就是算力账单;现在你可以用几毛钱的成本跑一个多步骤 Agent,做出能收费的产品。创业者的试错成本被压到前所未有的低。

所以这场价格战真正的战场不是"每百万 token 多少钱",而是"完成一个真实任务要花多少钱"。DeepSeek 的杀手锏不是绝对低价,而是把"单位有用结果"的成本打穿了地板。

对企业老板来说,这意味着什么?

以前你可能听说 AI 客服能省 40% 成本,但一算 API 账单发现省的钱还不够付 token 费。现在这个价格,很多场景的 ROI 是真的能算过来了。市场调研、合同审查、代码重构、数据清洗、多语言客服——这些原来要人干几天的活,Agent 可能几个小时就干完,成本还低一个数量级。

04 白菜价不是万能药

话说到这,我得泼点冷水。

便宜不等于好用,更不等于适合你。

DeepSeek V4-Flash 的架构没变,说明它的能力上限仍然受基座约束。后训练可以让它"更会干活",但不能让它"知道它本来不知道的事"。如果你的任务需要极强的专业知识、超长上下文推理、或者对错误率零容忍,基座更大的模型可能还是更稳。

另外,后训练的质量高度依赖训练数据和方法。一个模型可能被训练得很会考试,但一到真实场景就"照本宣科"、过度拟合 benchmark。你看到的分数很漂亮,实际用起来可能要多试几轮、多纠正几次。这些隐形成本,不会写在价格表上。

更微妙的是"评估漂移"。当某个 benchmark 成为行业通用标准,厂商就会针对它做专项优化,分数涨得快,真实能力不一定同步涨。这就像学生专门刷高考真题,模拟考分数上去了,进了大学未必能适应。所以看 benchmark 要看它测的是不是真实工作,而不是看谁的数字更大。

还有一个容易被忽略的点:API 兼容是把双刃剑。

DeepSeek 原生支持 OpenAI Responses API,开发者可以无缝迁移。这大大降低了试用成本,但也意味着你的工作流可能越来越依赖某个 API 格式。今天从 OpenAI 切到 DeepSeek 很容易,明天如果从 DeepSeek 切出去,也未必难。关键是别让自己的业务被一家公司的接口标准绑架。

所以我给企业选型提一个简单标准:别看"每百万 token 多少钱",看"完成一件事的总成本"。

总成本包括:模型调用费、重试费、人工审核时间、错误带来的返工、以及迁移和锁定的风险。有些模型 token 便宜但错误率高,算下来反而更贵。有些模型 token 贵但一次过,综合成本更低。

便宜是结果,不是目的。目的是用更低的成本拿到更靠谱的结果。

05 三类人,三句话

这场"后训练+价格战"的变局,对不同人意味着不同的事。

如果你是普通用户或小企业主:别追参数,追"同样钱能干多少活"。你可以开始认真试试 AI Agent 工作流了。以前可能因为贵而舍不得跑的多步骤任务,现在成本可能已经降到可以接受了。

如果你是开发者或技术负责人:拿 DeepSeek 这类兼容 API 做迁移实验,成本极低。但别让一家公司定义你的工作流抽象层。多封装一层自己的任务调度、重试、日志和评估体系,这样将来换模型不会伤筋动骨。

如果你是行业观察者或政策制定者:后训练的数据来源、价值对齐、安全护栏,会比预训练更快地浮出水面。当模型越来越便宜、越来越会自主调用工具,监管的重点也该从"模型有多大"转向"模型在真实场景里会做什么、做错了谁负责"。

过去两年,AI 行业像是在打一场"基因军备赛":谁的参数多,谁的数据多,谁的算力堆得高,谁就领先。

DeepSeek V4-Flash 这件事告诉我们:基因竞赛的天花板已经若隐若现,后天教育的红利才刚刚开始。

同一个模型,换种教法,成绩可以从二本冲到清北。价格还能砍到原来的 1/90。

这不是某个公司的胜利,这是一个时代的切换。

拼参数的时代,正在过去。拼后训练、拼工程化、拼单位结果成本的时代,来了。

对普通人来说,最朴素的判断标准也变了:别再问"这个模型有多大",要问"它帮我干完这件事,要花多少钱、要返工几次"。

答案越便宜、越稳定,AI 就越快变成你的员工,而不是你的玩具。

http://www.jsqmd.com/news/1328530/

相关文章:

  • 如何快速优化macOS鼠标体验:终极平滑滚动与按钮自定义指南
  • 论文答辩备考攒了12小时参考讲座视频2026实测免费视频总结工具免费额度够用吗
  • UEViewer:高效提取Unreal Engine游戏资源的终极解决方案
  • 【图像识别】基于模板匹配算法实现车辆出入库计时matlab系统
  • Unity热更新实战:YooAsset与HybridCLR双核框架搭建指南
  • 为什么新店开业要3个月?数字化中台实现“开箱即用”能力
  • qmcdump:3分钟掌握QQ音乐加密格式无损转换技术
  • 4步实现跨平台Steam创意工坊模组下载完整方案
  • 实测测评|新媒体营销方案 PPT 怎么做?智在 PPT 真实上手,不吹不黑
  • Unity图集切割实战:基于Texture2D.SetPixel的离线资源处理工具
  • 如何快速掌握绝区零一条龙:新手必备的完整使用教程
  • 数据标注有“三集”:训练集、验证集、测试集到底有什么区别?
  • 2026暑假老师效率助手:跳绳阅读练字打卡,作业收集批改全搞定
  • 无断链三维轨迹重构与战场情报溯源
  • 十万个why:为什么做RAG 最怕的,不是检索失败,是明令禁止瞎答,它还硬编答案
  • 屈原:世人只知屈原投江,却不知他的楚辞,是华夏浪漫文学的起点
  • 【信息科学与工程学】【数据中心】计算机科学与自动化——第三百零五篇 数据中心 Scale-Up、Scale-Out、Scale-Across101 芯片接入数据中心129
  • 杭州专业的蜂窝板材厂家怎么选?看工艺与交付更靠谱 - 热点品牌推荐
  • 2026徐州靠谱家装企业盘点,本土老牌徐州大自然装饰公司 - 招财兔数字员工
  • 网站时光机HTTrack:3分钟掌握离线浏览与数据备份终极指南
  • 英雄联盟Akari助手:免费开源的游戏效率工具,提升你的操作水平300%
  • 掌握谈判主动权,从读懂这本经典谈判书籍开始
  • 基于ARM+FPGA平台在精密测控领域的应用:ZYNQ高精度温振压多参融合采集系统
  • SpringBoot+Vue电影推荐系统开发与协同过滤算法实践
  • 杭州毛坯房地暖选择与安装全攻略
  • GEO技术如何操控大模型推荐系统及防御方案
  • 复杂电磁环境下石油通信训练,基于 HWG1 分析电磁环境模拟技术
  • AI宠物产品客观评测:核心参数与使用体验的实测解析 - 招财兔数字员工
  • 山海万灵 HarmonyOS 文化知识设计续篇(10):地图缩放与区域选中态协同方案
  • 线上竞拍实操技巧,理性参拍不冲动消费