当前位置: 首页 > news >正文

让Agent成本暴降90%!自动化Harness适配框架被CMU开源了

团队没有继续训练模型,而是让meta-agent分析失败轨迹,自动调整指令、工具和Agent循环。

结果很直接:优化后的harness在21个“任务-SLM”组合中的16个上显著提升性能,7个组合弥合了SLM与前沿LLM之间的性能差距。表现最好的SLM恢复了约89%的前沿LLM性能,推理成本仅为前沿LLM的4%。

01

不是换模型

而是把部分难度移出模型

当前很多Agent系统是围绕前沿LLM设计的。模型需要自己理解任务、制定计划、挑选工具,并在出错后重新规划。前沿模型通常能够较好地完成这些工作,SLM却更容易暴露出模型能力与任务需求之间的缺口。

作者将常见问题归为五类:工具使用失败(tool-use failure)、遵循指令失败(instruction-following failure)、知识失败(knowledge failure)、长上下文失败(long-context failure),以及规划或推理失败(planning/reasoning failure)。

问题并不完全出在模型无法完成单个步骤,而是它需要同时承担过多工作:既要推断流程,又要从大量工具中做选择,还要避免重复发送消息。

harness adaptation的思路,是把不同实例共享的部分难点固化到外部系统中。明确的步骤写入system prompt,重复操作封装为工具,不相关工具直接隐藏,必须遵守的条件交给程序检查。

模型不必临场解决所有问题,只需可靠完成harness为它划定的任务。

02

meta-agent

自动修改Agent系统

手工寻找合适的harness并不轻松。同一次失败可能同时涉及工具选择、上下文增长和指令遵循,而且不同模型的失败方式并不相同。

因此,研究团队把harness设计转化为一个由数据和评估驱动的搜索问题。

harness optimizer接收目标SLM、训练及验证数据和初始harness,在一个明确的空间中修改system prompts、skills、dynamic contexts、工具、hooks、上下文管理组件和sub-agents。

首先,从已经尝试过的harness候选池中采样一个版本,在训练实例上运行,并记录完整轨迹,包括工具调用、中间观察、输出、分数和反馈。

meta-agent读取原始轨迹与当前harness代码,诊断失败原因,再提出具体修改。它还会查看过去方案及效果,避免重复尝试已经证明无效的调整。

最后,新harness先经过低成本的代码检查,通过后,它会在同一批实例上重新评估,只有出现改进,才进入完整验证并被加入候选池。

团队使用gemini-3.1-pro-preview作为meta-agent。每个任务与模型组合的单次优化预算为20美元,执行三次独立搜索,再保留验证分数最高的harness。

这不是让Agent自由重写自己,而是在受约束的组件空间内,用真实失败轨迹寻找有效修改。

03

预算审批从75.0%升至98.3%

预算审批任务最能说明harness具体改了什么。

经过23轮迭代,优化器为gemma-4-26b-a4b找到了三项关键调整。

第一,把简短的通用提示改写为明确的逐步流程,规定联系人发现、信息收集、预算核对和消息回复的顺序。

第二,过滤不需要的MCP工具,缩小模型的动作空间,减少工具选择错误。

第三,创建anti_loop_hook.py。当Agent准备向同一接收人再次发送完全相同的消息时,hook会直接拒绝调用,并要求模型进入下一步或结束任务。

调整之后,gemma-4-26b-a4b的准确率从75.0%提升至98.3%,超过gemini-3.1-pro-preview的97.3%;单实例平均成本则从0.039美元降至0.017美元。

harness承担了脆弱的规划、筛选和检查,SLM只负责执行已经结构化的流程。

04

什么时候用小模型加harness

论文在七项业务相关任务上进行了实验,包括考勤审计、预算审批、库存预警、IoT时序异常检测、Playwright测试生成、网站管理和代码重构。

三款SLM分别是qwen3-coder-30b-a3b、ministral-3-8b和gemma-4-26b-a4b,对照模型为gemini-3.1-pro-preview。所有配置运行三次并报告平均结果。

三款SLM中,整体适配效果最强的是gemma-4-26b-a4b。它在通用harness下的七项任务平均准确率只有31.4%,优化后达到80.2%;平均延迟也从328秒降至135秒。前沿LLM的平均准确率为89.7%,平均延迟为181秒。

qwen3-coder-30b-a3b的平均准确率从26.9%提升至74.8%。但ministral-3-8b只从9.5%提升至25.0%,部分任务仍然没有改善。

这说明harness可以转移任务难度,但无法替代模型缺失的核心能力。

因此,预算审批、考勤审计、库存预警等流程相对固定的任务,更适合使用“小模型+专用Harness”,代码重构等需求差异较大的开放任务,则更难依靠一套Harness覆盖。

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

http://www.jsqmd.com/news/1297640/

相关文章:

  • 天津geo优化公司推荐榜怎么参考?广拓时代谈选型逻辑
  • 学术论文降AI工具:原理、效果与使用技巧
  • 2026年 3款VIVO通话转文字哪个好?实测筛选后这款不踩雷
  • Oracle 11g 透明网关连接 SQL Server
  • 备赛期训练计划设计:从增肌到备赛的精细化调整策略
  • ANSA二次开发JSON数据写入:自动化CAE前处理技术详解
  • 别卷模型智商了:AI 大模型岗位的“生死线”其实是权限与日志
  • 18-子Agent委派-并行任务效率翻倍
  • Kali Linux 中文环境配置完全指南:从系统语言到输入法
  • 天津geo优化公司哪家服务好?广拓时代拆解真实交付标准
  • 优先级队列与反向迭代器:高效数据处理技术解析
  • WordPress 部署全攻略:从零到上线,手把手搭建你的网站
  • SpringBoot 3 + Vue 3全栈竞赛管理系统开发实战
  • 开门造车:为什么不用等做完再说
  • 基于微信小程序的小学生课后托管服务系统设计与实现
  • 便携式宠物粪便清理器的机械设计与创新
  • 给芯片供应链装上“中国连接器”:EasyLink×TI/英飞凌对接案例
  • UE5 ALS V4站立状态机解析:六方向无缝过渡与洋葱模式动画设计
  • 线性锂电充电管理IC TC4056A:低成本便携设备的电源基石
  • Python JSON完全指南:从核心函数到实战优化
  • UART串口通信:从协议帧格式到STM32实战与排错指南
  • 遵义母婴除甲醛公司测甲醛中心怎么选:金耀母婴除甲醛标准、流程、避坑指南 - 信誉隆金银铂奢回收
  • Zynq双核通信与OpenAMP框架实战:Cortex-R5温控系统开发指南
  • 【2026年百度暑期实习/秋招- 7月30日-后端AI Coding-第一题- 选择题】(题目+思路+JavaC++Python解析+在线测试)
  • 5.7 万 Star 的 MemPalace:Agent 记忆层,先别急着总结
  • 平衡车-电机调速和调向
  • 知识直播、带货和录课画面不能套一套模板:OBS 平替推荐
  • 计算机毕业设计之汉服文化宣传分享平台设计与实现
  • Python数据分析实战:从数学建模到可视化呈现的完整项目指南
  • BBWEYY 外贸公司低成本获客转化解决方案:外贸企业如何做好海外SEO与GEO协同?BBWEYY独立站内容布局,含零代码SAAS、AI编程、源码定制交付