当前位置: 首页 > news >正文

实测!DeepSeek V4 Pro配自家Harness,响应更快、缓存命中率提升1%!

【DeepSeek V4 Pro正式版上线波折】

近期,DeepSeek持续上演反转。8月12日,没有发布会,没有预告,DeepSeek悄悄更新API文档,编号为 "0813" 的DeepSeek -V4-Pro正式版模型深夜静默上线。高关注度和期待之外,是现实体验与官方跑分之间的落差,还有一经上线便预告涨价的质疑。8月13日,距离新模型发布不到24小时,DeepSeek官网首页发布的横幅和开放平台公告突然被撤下。API文档中模型名称没变,开发者仍可正常调用,但官方保持沉默。事后,有开发者发现DeepSeek在Hugging Face后台代码仓库疯狂抢修,疑似因为前端接口、后端推理栈与权重配置出现了严重错位,导致体验 "翻车"。同天晚上,DeepSeek重新发布公告确认V4 Pro正式版上线,同时开源DeepSeek Harness开发者预览版,一切又回到了主场。

【Model+Harness=Agent】

DeepSeek曾给出过一个公式:Model+Harness=Agent。这意味着,对可执行任务的Agent来说,只有模型是不完整的。Harness的可控、可观测、可回溯的特性,补上了模型所缺失的另一半。模型是大脑,负责思考、推理和理解意图。但纯语言模型只能输出文本,无法直接操作文件、修改数据库和浏览网页。Harness是 "身体" 和 "神经系统",它提供了模型与外部世界交互所需的一切,包括工具调用、文件读写、沙箱环境、权限管理、任务编排等。没有Harness,模型只是一台会说话的引擎,但无法成为真正干活儿的Agent。DeepSeek试图通过自身打造的Harness系统,将模型性能发挥到最大化。从测试结果来看,也的确如此。在DeepSeek Harness加持下,DeepSeek V4 Pro正式版的响应速度更快,且比接入Claude Code缓存命中率提升了1%。

【祛魅和争夺范式】

“一切皆插件”是DeepSeek Harness最核心的设计理念。简单来说,就是从模型、工具到最核心的Agent Loop,都拆解为可独立、组合的插件。这个理念由北大与DeepSeek联合提出的“时空可组合性”范式支撑,该范式将Agent组件拆解为两个维度。一是时间可组合性通过“可逆效应”机制,让系统自动记录并撤销组件卸载后的副作用,加载过程即决定卸载过程,确保系统长期稳定。二是空间可组合性通过“响应式共效应”实现声明式依赖管理,组件只需声明需求,运行时就能自动协调依赖变化,实现动态激活与停用。两者融合于统一的上下文、承载状态、生命周期边界和依赖环境。Harness因此可实现“无特权核心”,所有组件包括Agent主循环均可替换,开发者通过配置文件即可自由组合。这一理念为构建灵活且面向未来的Agent基础设施奠定了方向。

在OpenAI、Anthropic等巨头纷纷定义自己的Harness时,DeepSeek的思路显得独树一帜。OpenAI和Anthropic的战略是“向下整合”,即通过打造体验极致、深度绑定自家模型的Harness,巩固其在AI应用层的优势;DeepSeek的战略是“横向铺开”,不再满足只做一个优秀的模型供应商,而是试图通过开源一个模型中立、高度模块化的Agent底层标准,成为下一代AI应用的基础设施。网传的DeepSeek Harness内测入选项目名单同样释放了强烈的信号,入选项目高度集中在能夯实Agent能力的基础设施领域。其项目主要围绕MCP插件、代码智能体、运行时、编排框架、可视化UI与多智能体调度等方向,直指Agent在真实世界落地的核心难题。

DeepSeek的一系列操作,可视为一场精心设计的“祛魅”运动。DeepSeek开源Harness,并大力扶持各类基建插件,本质上是在做一件事:将“如何构建一个强大的Agent”的一整套方法论和源代码,公之于众。在此之前,OpenAI和Anthropic的Harness更像一个“黑箱”,其内部优化是核心机密,如何打造Agent产品被视为一种“特权”。DeepSeek通过开源和Cordis插件理论,主动拆解了这个黑箱,并证明Agent的强大不在于某一个神秘的内核,而在于一套可组合、可替换的工程组件。当Harness被充分祛魅,成为一个透明、可被随时替换的组件后,整个价值链上,唯一不可被标准化、仍会持续进化的,就只剩下最底层的“模型”本身了。如果把DeepSeek的模型、开源、Harness、涨价四个动作连在一起看,就会发现DeepSeek的目标非常明确。先建立生态,再定标准,然后用最强的模型性能,完成商业价值的最终变现。Harness和开源就像是免费修建的高速公路,前期用来吸引车流,而当车流足够多时,顺势提高燃油的价格,便成为了最高效的商业兑现方式。

【砍掉prompt,场景一次跑通】

昨天的文章里,测评了DeepSeek -V4-Pro-0813的七项复杂任务,唯独指环王那题没有跑完整。当时为了赶时间,只给了《指环王》第一章的3句开头。恰好DeepSeek Harness也出来了,就在DeepSeek自家的Harness里跑这次完整的测试,看看自家的工具配自家的模型,能擦出怎样的火花。安装的过程就不赘述了,推荐大家用npm(Node.js的默认包管理器,安装并管理项目所需的各种第三方库,可以简单理解为一个开放的应用市场)安装,也方便升级和安装其他插件,可以直接运行npx @deepseek-ai/dsh web启动,如果卡住不动的话,可以先运行一遍npm install -g @deepseek-ai/dsh,然后再运行刚才的命令就可以顺利启动了。初次打开和大部分Agent一样,只不过在DeepSeek Harness这里暂时还是极简的画风。

装好环境之后正式开始今天的测试,《指环王》这个基准测的不是“会不会画一只鹈鹕”,而是“读懂一段文学→理解一个世界→把世界程序化搭出来”的完整链路,是目前圈内最狠的Agent考题之一。昨天的测试为什么不算数?因为当时只给了3句开头,而Karpathy给Opus 5的是原著第一段。今天把原文补齐:第一章前段完整文字,从比尔博宣布111岁生日宴会,到霍比屯议论,再到弗罗多身世往事,共计1817个词、23段,一字不改。

第一次测试,按“评测就该严谨”的思路,把提示词写得滴水不漏,1817个词的原文,加上场景要素清单(洞屋要有圆形门、宴会长桌要有食物、宾客要议论纷纷),再加上运镜要求、灯光要求、比例要求,一共五条硬性要求。结果很打脸,第一次生成的效果非常粗糙,叙事也不完整。场景是搭出来了,但离“霍比屯的生日派对”相距很远。效果呈现上,运镜支离破碎,画面像是赶工出来的半成品。穿模很严重,山坡上站的小人像是插了一堆棒棒糖。复盘了一圈,把原因归结为提示词太长了,列出的场景限制了模型的发挥。

第二次,把提示词砍到只剩目标,读懂原文,用Three.js搭出霍比屯生日派对的3D世界,运镜按原文节奏走,保存为完整可运行的HTML文件。场景要素、灯光、比例要求,全部删掉。效果反转了。场景竟然一次就跑通,洞屋、比尔博、弗罗多、宴会长桌、酒馆前议论的霍比特人,该有的都有;角色只有轻微漂浮和穿模,属于“能看出是霍比屯”的范畴;运镜叙事成立,按原文节奏从俯瞰霍比屯推到比尔博,再扫过议论的人群,最后环绕宴会长桌。

同一个模型,同样的原文,一个细致入微的提示词换来翻车,一句直白的目标换来及格以上的结果。看来现在顶级的模型反而不需要详尽的提示词,只需要用直白简洁的话告诉他目标就可以了,说多了反而效果会变差。这不是孤例,GPT-5.6 Sol刚发布时,社区就有人反馈,套上精心优化的提示词和流程skill,反而会让模型陷入死循环。这个发现值得单独提出来,提示词的作用正在从“写剧本”变成“定目标”,给顶级模型写小作文的时代可能真的过去了。

【DeepSeek Harness到底行不行?】

回到今天的正题,DeepSeek Harness配自家的V4 Pro,表现如何?响应更快了。同样的测试,DeepSeek Harness里的响应比前一天在Claude Code里接入时更快。缓存命中率涨了一个点。前一天在Claude Code接入是98%,在DeepSeek Harness里是99%。这个提升看起来小,但在长上下文任务里,缓存命中率每涨一个点,都是实打实地关系到成本和生成速度。

再看测试本身,第一次的长提示词翻车,发生在DeepSeek Harness环境里;第二次反转,也在同样的环境。但全程没有环境相关的报错、卡顿、上下文丢失,两轮测试的对比是干净的,变量只有提示词本身。作为一个刚发布的开发者预览版,这是很加分的稳定性,而且DeepSeek Harness还会把运行过程中每一步都显式的呈现出来,可以看到模型是怎么工作的,这是一个很好的创新。

短期内,DeepSeek Harness所能产生的作用还很有限,作为普通用户很难像使用WorkBuddy一样在工作中提效。但从长期来看,DeepSeek Harness与DeepSeek系列模型,形成了难以割裂的增强闭环。Harness作为完全开源的Agent框架,定义了“模型如何被调用、工具如何被组合、任务如何被编排”的底层标准,吸引了海量开发者和真实任务涌入。而这些真实任务的执行轨迹,通过Harness内置的可观测体系,源源不断地回流,为DeepSeek模型下一轮训练与优化提供天然数据养料。反过来,DeepSeek模型能力的每一次跃升,Harness又能第一时间通过内置适配器将其能力释放到插件生态中。当这套飞轮转起来,开发者的选择就变得不再困难。因为使用DeepSeek Harness,就会得到一个始终与最强模型同步进化,且无需二次适配的开箱即用系统。这正是DeepSeek所定义的“Agent=Model+Harness”的终极形态,一个彼此增强又不可分割的完整个体。

http://www.jsqmd.com/news/1399980/

相关文章:

  • 粤泓(深圳)建筑咨询有限公司-2026广东环保工程资质一级代办实力之选:专业底蕴与高效服务双轮驱动 - 卓企推荐
  • gh_mirrors/tr/trading测试策略:单元测试到集成测试的完整实践
  • 无需编程!Homepoint配置文件详解:JSON设置WiFi、MQTT与屏幕参数
  • WallYou壁纸应用完整上手指南:一款注重隐私的开源自动换壁纸神器
  • vim-rspec与Dispatch/Zeus协同:打造极速测试环境
  • 2026年建筑装修装饰工程一级资质代办机构选择参考 - 卓企推荐
  • ICT智能体数字园区价值场景
  • Natlas API开发详解:自动化扫描任务与数据查询接口使用指南
  • VManagePlatform网络管理终极教程:OpenVSwitch与Linux Bridge配置
  • 金华市磐安县GEO服务商代理加盟怎么选?2026年国内靠谱品牌推荐与避坑指南 - 科技快讯
  • 单糖App部署与测试指南:Xcode配置与第三方库管理全流程
  • 杭州黄金回收报价纷繁复杂,收的顶依照实时金价合理估价 - 日常前沿快讯
  • 2026年邯郸钻石戒指回收,(185-3117-2838)丛台区中华北大街29号赵掌柜二奢十年老店回收鉴定钻石戒指回收钻戒回收钻石项链 - 赵掌柜二奢
  • 如何解决TC²-BBS-mesh常见问题:从连接到同步的实用技巧
  • swift-embedded进阶教程:如何为新的STM32F4系列开发板添加支持
  • Mockito for Dart核心功能解析:when、verify与参数捕获实战
  • 如何在10分钟内搭建Relay Fullstack项目:从安装到运行的快速教程
  • ComfyTextures三种工作模式对比:Create/Refine/Edit适用场景与技巧
  • FastGAN-pytorch预训练模型使用教程:从Docker到本地部署的简单步骤
  • 革命性React弹窗管理库overlay-kit:如何用声明式API彻底简化模态框开发
  • 如何在5分钟内创建你的第一个Darkwallet:安全钱包设置与种子备份教程
  • 摩托车托运哪个物流好?2026年电动车托运避坑指南+省钱攻略 - 快递物流资讯
  • Obfusk8高级技巧:用obfuscate_pe.ps1脚本消除PE文件 forensic 痕迹
  • VictoriaMetrics/metrics性能优化指南:低内存占用监控实践
  • MAMEToolkit核心组件解析:Emulator与Environment工作原理
  • 干货别划走!2026中山包包老店回收实测报告,上门回收当场现金结算,无手续费安心出闲置! - 品牌观测员
  • 嵌入式开发老手也头疼的三个难题,FPrime 如何用“搭积木“的方式逐个击破
  • ORB_SLAM2_ROS常见问题排查:从编译错误到运行时异常全解决
  • Kali Linux渗透测试实战指南:从零构建网络安全攻防思维与技能
  • backoff完全入门:从安装到实战的简单教程