当前位置: 首页 > news >正文

DeepSeek 的便宜模型跑赢了自家旗舰——AI 进步最快的地方,已经不是堆参数了

一个 284B 的"廉价版",没换架构、没加参数,只靠重新训练,就在 9 项 Agent 测试里整体超过了自家 1.6T 的旗舰。这件事正在改写一个你以为理所当然的判断:贵的不一定是对的。

7 月 31 日,DeepSeek 做了一件反直觉的事。

他们把自家 V4 系列里最便宜的 Flash 模型重新训练了一遍——没换架构,没加参数,连模型尺寸都没动。然后,这个只有 284B 总参数的"廉价版",在 9 项 Agent 能力测试里整体超过了自家 1.6T 参数的旗舰 V4-Pro 预览版。

知名 AI 博主宝玉在 X 上的原话是:「便宜的那个模型(Flash)经过后训练调优之后,在编程和工具调用任务上反超了贵的那个模型(Pro)的预览版。」

到底发生了什么

DeepSeek-V4-Flash 正式版 API 在 7 月 31 日上线公测,版本号 0731。

这次更新最特殊的地方在于:模型本身没变,变的是训练方式。

Flash 还是那个 Flash——284B 总参数、13B 激活的混合专家架构(MoE),和 4 月份的预览版一模一样。变的是"后训练"环节:用新的指令数据、强化学习和工具使用轨迹,重新教模型怎么在实际任务里"动手"。

相当于同一个人去集训了一圈,脑容量没变,但出手突然变老练了。

DeepSeek 官方一口气公布了 9 项 Agent 基准成绩,并明确表示:正式版 Flash 在这些测试上整体超越了 V4-Pro-Preview。

9 项测试,数字有多离谱

最直观的冲击来自一个叫 DeepSWE 的基准——它专门测试 AI 能不能像真正的工程师一样,在一个真实代码仓库里定位 bug、改代码、跑测试、提交结果。

Flash 预览版的成绩是7.3

正式版直接跳到了54.4——涨幅645%

这不是"提升了一点",是"从不太会变成了真的能干"。

其他几项同样值得注意:

  • Terminal Bench 2.1(终端操作能力):82.7。V4-Pro 预览版是 72.1,Flash 预览版只有 61.8。

这个测试衡量的是 AI 能不能在真实的命令行环境里完成多步骤任务——不是"写一个命令给你看",而是自己跑命令、看反馈、处理报错、继续修复。

  • Toolathlon(工具编排能力):70.3。测试的是 AI 能不能从一堆工具里选对工具、按对参数、串成一条完整流程。
  • DSBench-Hard(高难度开发任务):59.6。全栈开发任务,前端后端 API 测试一起改。

这个便宜模型不只是在"写代码",而是在"跑环境"。

最反常的地方:进步不靠堆参数,靠训练方法

过去两年,AI 行业有一个近乎共识的直觉:模型越大越强。参数翻倍,能力上一台阶。

但这次 DeepSeek 做的事情恰好相反。

284B 的 Flash,总参数只有 1.6T 旗舰 V4-Pro 的不到五分之一。每次推理只激活 13B 参数,成本大约只有 Pro 的一个零头——API 定价 $0.14/百万输入 token、$0.28/百万输出 token。

按传统逻辑,它应该在旗舰面前被碾压。

但后训练改变了一切。同一个基础模型,本来可能已经"知道"Git 怎么用、Linux 怎么操作,但如果没经过足够的工具使用训练,它就会反复执行失败的命令、选对工具但传错参数。

后训练解决的不是"知不知道",而是"会不会用"。

这对开发者意味着什么:选模型的逻辑要变了

以前团队选模型的默认动作是:先用最贵最大的,跑不动了再找便宜的降级。

如果 Flash 正式版的能力可以持续验证,更合理的做法可能是反过来:大部分日常任务用 Flash 跑,反复失败或需要密集知识推理时才升级到 Pro。

这直接影响 Agent 产品的账本。一个 Agent 任务往往涉及几十轮模型推理、工具调用和错误纠正——成本不是"聊一轮多少钱",而是"成功交付一个任务总共花多少钱"。

一个单价低但老出错的模型,算下来未必便宜;一个单价更低但一次就做对的模型,才是真的省钱。

这正是我们「AI 落地账本」系列一直在追的主线:AI 的成本竞赛,已经从"谁的模型更便宜"变成"谁的便宜模型更能干活"。

对普通人意味着什么:你为 AI 付的钱,正在被重新定价

如果你不是开发者,这件事和你仍然有关。

AI 公司正在用两种方式压低成本:一是把模型做小(Flash 只激活 13B),二是把训练做精(后训练提升效率)。两条路叠加的效果是:同样能力的 AI 服务,价格正在快速下降。

你用的 AI 写作工具、代码助手、客服系统,背后的推理成本在变低。这意味着更多免费额度、更低的订阅价格、更多原本收费的功能变成标配。

但也别急着欢呼。DeepSeek 官方也承认,Flash 在复杂运动物理合理性、极多主体交互等场景上仍有短板。Agent 基准跑分高,不等于在生产环境里一定可靠——第三方复测、真实仓库任务成功率、单任务综合成本,这些数据还需要时间验证。

现在可以怎么做

  • 开发者:把deepseek-v4-flash接进你的 Codex 或 Agent 工作流试跑。Flash 正式版原生兼容 Responses API,VS Code 和 Codex CLI 可直接配置。建议先在非关键任务上对比 Flash 和 Pro 的交付成功率,再决定默认模型。
  • 创业者:如果你的产品重度依赖 AI 执行能力(而不只是对话),Flash 的成本结构值得重新算一遍账。便宜模型 + 好的训练,可能比贵模型 + 粗放调用更划算。
  • 普通用户:不用纠结用哪个模型。但记住一个判断——"贵=好"在 AI 领域正在失效,选工具时别被"我们用的是最贵的大模型"这种话术唬住。

结语

DeepSeek 这次做的事情,本质上是给整个行业提了个醒:

你可能不需要一个更大的大脑,而是需要一个训练得更好的大脑。

当 284B 的便宜模型在 Agent 任务上跑赢了 1.6T 的旗舰,"参数军备竞赛"就不再是唯一主线了。下一个值得关注的,不是谁的模型又大了多少倍,而是谁用同样的模型,训练出了更强的执行力。

http://www.jsqmd.com/news/1315169/

相关文章:

  • PMX转VRM:从格式转换到性能调优的完整实战指南
  • 如何批量获取精准同步歌词?LRCGET让本地音乐库焕然一新
  • 力佳科技:纽扣电池源头工厂,产品出海无忧
  • AI学习风格分析必须掌握的5个硬核指标:β波同步率、眼动熵值、响应延迟斜率、知识图谱覆盖率、元认知自评一致性
  • 想把获客做成资产的财税公司找企跑星怎么做,资产化路径 - 欢欢在创业
  • 多智能体系统生产环境避坑指南:死循环与 Token 爆炸的终结方案
  • UE地形材质优化:从贴图合并到近景位移的完整性能与视觉提升方案
  • PyTorch环境配置全攻略:从Anaconda虚拟环境到CUDA版本匹配
  • Unity命令行构建实战:从环境配置到CI/CD集成的完整解决方案
  • 网络环境规划
  • SPT-AKI Profile Editor:离线版逃离塔科夫存档编辑终极指南
  • 树莓派集成7.9英寸DSI LCD全攻略:从硬件连接到软件配置与优化
  • Python从入门到实战:基础语法、网络爬虫与数据分析完整学习路径
  • AI热点预警机制失效的5个致命盲区:从GPU利用率异常到LLM幻觉突增的实时捕获策略
  • 开发者必知:软件专利申请的实操指南与核心误区解析
  • 企业数字化营销的技术演进:从SEO到GEO,AI搜索时代的流量获取逻辑分析
  • 北京顺义刑事律所推荐:临空经济区走私犯罪辩护实务解析 - 品牌深度评测
  • ESXi Unlocker终极指南:5步解锁VMware ESXi上的macOS虚拟化能力 [特殊字符]
  • 庆祝中国人民解放军建军九十九周年
  • 电竞舆情监测系统:基于NLP与爬虫的虚假信息识别与自动辟谣方案
  • 抖音无水印下载终极指南:三步解锁高清原画视频保存
  • Ubuntu 用户账户管理和组管理
  • [具身智能-714]:colcon build 是 ROS2 官方工具,自动扫描 src 内所有功能包,按依赖顺序编译代码,生成可运行程序;搭配 --symlink-install 适合机器人日常开发
  • AIGC电商实战班:即梦+SD+豆包直出详情页,扫地机洗发水猫粮多品类可复现
  • 单片机毕设项目:基于 51/STM32 单片机的多档位调光人体感应台灯实现 基于光敏电阻采集的自动调光人体感应台灯控制系统(021401)
  • 抖音批量下载终极指南:5分钟掌握douyin-downloader高效使用技巧
  • 315MHz RF Kit入门指南:从无线通信原理到Arduino实战应用
  • 从ELK剑魔爆砍蒙多解析英雄克制:版本答案与玩家认知的博弈
  • UE4蓝图动态加载实战:从路径获取到实例化的完整指南与避坑
  • 做直播该选哪种云端方案?云直播、数字人录播、超级直播间一次讲清