DeepSeek-V4-Flash正式版Agent实测:执行任务能力到底提升多少?
DeepSeek-V4-Flash正式版发布,正式版重点提升了Agent任务处理的能力。
直接通过两个任务测试它Agent 执行复杂任务的能力。
本次设计两个实际任务:
一个偏基础:文件处理与数据计算
一个偏复杂:网络信息获取与分析
分别测试:
思考模式
非思考模式
重点观察:
任务是否完成
执行过程是否稳定
遇到问题是否会解决
最终交付质量如何
测试一:Excel数据生成与处理任务
任务内容
帮我生成50个学生成绩测试数据,包含学生姓名、语文、数学、英语、物理、历史成绩,并保存到Excel文件。然后读取Excel文件,计算每个学生平均成绩和总成绩,添加到原数据中,最后保存新的Excel文件。
思考模式表现
首先规划任务,规划的十分详细,后续执行也是严格按照规划过程执
所有步骤都准确无误的地执行,最终结果有效。
在计算总成绩和平均成绩时,消耗token:22530,用时2分12秒。
思考占用大量时间和token消耗,在思考的前1/10,就输出了要计算的结果。剩下的都在验证数据计算是否正确,它通过多种方式验证计算是否正确。
- 每个学习成绩逐项相加计算总分数和平均分数,验证是否与初始生成的相同
- 每个学科相加后计算所有学科的总成绩,验证是否与每个学生的总成绩之和相同。
- 基于两种方式计算的总成绩,又验证总平均成绩是否相同。
- 再次使用计算的每个学生的总成绩/5对比平均成绩是否相同。
- 再次以每个同学的成绩逐项相加,计算总成绩和平均成绩,并验证是否与初始数据是否相同。
头尾两次完整计算数据输出,中间5轮数据验证。
每次验证的过程和结果都是正确的,感觉有点过度思考了。
验证的目的是判断输出的计算结果是否正确,这本身没有问题,经历5轮数据验证,确实有助于反复验证数据是否准确。
但验证本身与输出数据一样,也是可能出现输出错误问题的,5轮验证很可能反而提高了输出错误的风险。
最后任务顺利完成
非思考模式表现
首先规划任务:
但过程中出现一次,生成的数据不符合要求,不是标准的二维数组。不过模型没有直接失败,而是重写构造正确的数据完成任务
最终结果
最后完成任务,执行速度明显比思考模式更快。
第一个任务总结
这个任务包含多个连续操作:
步骤 | 任务 |
|---|---|
1 | 生成50名学生数据 |
2 | 写入成绩数据到Excel文件 |
3 | 读取Excel文件 |
4 | 计算总成绩、平均成绩 |
5 | 将数据汇总 |
6 | 保存新文件 |
属于典型办公自动化 Agent 场景。
思考模式 和 非思考模式 执行结果对比
模式 | 执行结果 | 耗时 | Token消耗 | 缓存命中 |
|---|---|---|---|---|
思考模式 | 成功完成 | 4分32秒 | 71022 | 17024 |
非思考模式 | 成功完成 | 46秒 | 43055 | 26624 |
思考模式输出的规划过程更详细、输出的结果更正确。但思考过程耗时较长,token消耗较多
测试二:AI热点资讯获取与分析任务
任务内容
查询网络信息,获取最近几天热点AI资讯,汇总摘要,并附原文链接。筛选1-2篇偏AI技术应用方面最有价值的资讯,分析应用发展前景。
相比第一个任务,这个任务难度更高。因为它不是一个仅靠内部就可以闭环的任务,任务中可能遇到各种未知的问题。
思考模式执行过程
任务规划,规划得很详细,逻辑清晰。
实际执行时,遇到机器之心需要订阅问题。
只有订阅后才可以获取网络链接地址和具体内容
它识别到问题后,拼接了一个rss的链接地址https://www.jiqizhixin.com/rss,
访问失败后,它又开始构造新的地址https://www.jiqizhixin.com/rss.xml,
它好像一直没有Get,未订阅不能访问数据。
解决办法,要么订阅后获取数据,要么放弃从这个完整获取数据。而是一直自己的尝试用野路子。
尝试 | 结果 |
|---|---|
寻找隐藏链接 | 失败 |
构造RSS方式获取 | 失败 |
寻找订阅源 | 失败 |
继续尝试获取 | 失败 |
最终因为持续循环,我主动终止任务。
非思考模式执行过程
规划执行流程,流程同样很清晰
与思考模式一样,它也规划了从机器之心获取数据,虽然它也经过了多次尝试获取网页数据,但它最终判断出要订阅才能获取链接地址,在未获取到链接地址的情况下退出了该子任务
接着,他在36氪AI频道获取了数据,最后选取了两篇文章访问具体内容,生成总结与分析。
但在最终输出结果时,他丢失了获取的咨询列表,仅保留两篇重点分析的文章。还好他自我检查出来了。
然后他重写规划,最后顺利完了任务
在整个任务执行过程中,它的整体逻辑比较清晰,虽然也有错误,但它能够即使发现错误,然后纠正错误。
在之前的预览版中它,任务完成就结束了,不会验证结果是否符合要求。
第二个任务暴露的问题
这个结果其实很有代表性。
DeepSeek-V4-Flash正式版明显增强了:
1. 问题解决意识
以前模型:
工具失败 → 返回失败原因
现在:
工具失败 → 分析原因 → 尝试解决
这是Agent能力的重要提升。
2. 任务交付意识
相比预览版:
正式版明显更关注最终结果。
以前:
执行完成即可。
现在:
会尝试:
- 丰富结果
- 检查内容
- 优化输出
更像一个真正执行任务的助手。
但是:
3. 缺少停止判断
这是目前最大的问题。特别是思考模式,存在过度思考的问题。过度执着与不能完成的任务。
Agent不仅需要:
解决问题能力
还需要:
判断什么时候应该停止。
否则:
越强的思考能力,可能导致:
- 更长执行时间
- 更多Token消耗
- 无意义循环
DeepSeek-V4-Flash正式版 vs 预览版
从这次测试来看,最大的变化不是模型知识提升,而是 Agent行为变化。
能力 | 预览版 | 正式版 |
|---|---|---|
任务执行 | 能调用工具 | 更关注完成任务 |
异常处理 | 容易失败 | 会尝试解决 |
结果检查 | 较少 | 明显增强 |
最终交付 | 完成即可 | 更加关注质量 |
失败处理 | 直接结束 | 寻找替代方案 |
通过两个任务测试:
DeepSeek-V4-Flash正式版相比预览版,Agent能力有明显提升。
主要提升集中在三个方面:
提升方向 | 表现 |
|---|---|
结果检查 | 执行完成后主动验证 |
问题解决 | 失败后尝试寻找方案 |
任务交付 | 更加关注最终结果 |
但目前仍存在:
问题 | 影响 |
|---|---|
思考模式耗时长 | 执行效率下降 |
Token消耗高 | 成本增加 |
缺少停止策略 | 容易陷入循环 |
这次测试虽然只有两个任务,并且都是单次执行,存在一定随机性。
但从实际Agent使用角度来看,一次任务执行能力本身就是重要指标。
从测试结果来看,DeepSeek-V4-Flash正式版相比预览版,最大的变化不是单纯能力提升,而是明显具备了更强的 Agent 思维方式
真实任务环境和Demo展示有很大区别。
Demo通常都是:
固定流程
已知工具
理想环境
没有异常情况
而实际工作中:
网站可能无法访问
数据可能不存在
工具可能失败
文件格式可能异常
用户需求可能存在歧义
永远会出现模型训练中没有覆盖的情况。
这也是当前Agent最大的挑战:
不是能不能完成任务,而是遇到未知问题时,如何快速找到正确方向。
未来Agent能力评价不能只看:
“这个任务能不能完成”
还需要看:
“能不能快速完成”
“能不能稳定完成”
“消耗多少成本完成”
因为在真实生产环境中:
一次成功但耗时10分钟、消耗几十万Token的Agent,并不一定比一个几十秒完成任务的Agent更优秀。
真正优秀的Agent应该同时具备:
解决问题的能力 + 判断问题的能力 + 控制成本的能力。
DeepSeek-V4-Flash正式版已经迈出了重要一步,在Agent任务中,它开始像一个真正执行任务的助手,但距离一个可靠、高效,还有不少优化空间。
