当前位置: 首页 > news >正文

大多数人以为LLM进步只靠模型权重 Meta-Harness却让AI自己优化自己的harness

你是不是也这样卡在LLM系统优化上:模型权重已经刷到天花板,prompt、agent、eval harness却还是靠人工一遍遍拍脑袋改?每次改完测一次,trace长到几百万token,到底哪个改动真正起了作用完全靠猜。人类工程师每天盯着日志熬夜,AI却只能“被动等待”更好的scaffold。

我起初以为,LLM自进化最难的部分是让模型自己生成更好代码。后来读完Stanford AILab Yoonho Lee团队刚发布的Meta-Harness,才发现真正的瓶颈从来不是生成,而是长时序credit assignment——如何在海量历史代码、完整trace和评分之间,自动找出“哪个改动真正让系统变强”。

Meta-Harness的核心洞见:把coding agent当proposer,给它完整文件系统历史

传统优化循环要么只看reward summary,要么只看最近几次尝试,信息被严重压缩。Meta-Harness直接反其道而行之:

  • 用一个coding agent作为proposer
  • 赋予它完整文件系统访问权(历史目录可以变得极大)
  • 让agent在迭代中自由选择性阅读几十甚至上百个历史文件,形成针对性假设

这就像给工程师一个“无限回放”的Git仓库+全部实验日志,而不是只给他一份总结报告。论文里真实记录了agent在TerminalBench-2上阅读82个文件后的思考过程,和人类工程师的debug路径惊人一致:先定位失败模式,再形成假设,再精准修改。

下一轮迭代

coding agent proposer

选择性阅读历史文件
形成针对性假设

提出新harness修改

执行评估
生成新trace+score

为什么“完整历史”比任何summary都重要 实验直接打脸了之前的所有text optimization

作者明确指出:之前所有只看reward/summary/最近尝试的循环,在长时序任务上都严重underperform。因为依赖关系跨越几十次迭代,几百万token的raw output里藏着微妙的failure signal,一旦被压缩就彻底丢失。

Meta-Harness让agent自己决定“现在要看哪段历史”,而不是人类预先定义好看什么。这一步把“长时序credit assignment”这个最难的问题,直接交给了AI自己去解决。

Meta-Harness本质上是一个“优化其他harness的harness”

它几乎是meta-learning的极致形式:

  1. 让agent可以检查任何一段历史
  2. 给它一个明确的hill(performance metric)去爬

没有强加的结构,没有预定义的mutation operator,纯粹让agent在真实工程环境中进化。这和Darwin-Gödel Machine、EvoSkill等工作的思路高度一致,但结构更少、自主性更强。

传统harness优化 vs Meta-Harness 硬核对比矩阵

维度传统人工/总结式优化Meta-Harness(完整历史+agent proposer)谁更具突破性
信息利用度只看summary或最近几次尝试完整raw history,可选择性深度阅读Meta-Harness碾压
Credit Assignment人类手动猜Agent自主形成长时序假设Meta-Harness完胜
适用场景短周期、简单promptTerminalBench-2这类硬核长时序任务Meta-Harness更硬核
人类干预程度极低(agent自己读、自己想、自己改)Meta-Harness更自主
泛化能力容易过拟合特定任务论文已验证held-out tasks、不同LLM、不同领域Meta-Harness更稳
工程现实性需要大量人工调试直接跑在真实文件系统上Meta-Harness更落地

评论区最有价值的几个洞见(直接来自一线研究者)

  • @DimitrisPapail 笑着说“oops just got scooped”,Yoonho回复“great minds think alike”——说明这个方向已经在多个顶级团队同时涌现。
  • @bygregorr 精准指出:如果模型本身推理能力不够,优化harness只是“更快地测同一个天花板”。Yoonho回复承认harness有模型权重设定的上限,但它能解锁权重里已经存在却没被用好的能力。
  • @Vtrivedy10(LangChain团队)分享了他们在TerminalBench-2上的实战经验,并讨论了“overfitting to the hill”的权衡。Yoonho详细回复了泛化测试方法(held-out instances、unseen LLMs、unseen domains)。
  • 多位开发者提到这和他们内部的autoresearch、Trace2Skill高度互补:一个优化harness,一个提炼reusable skill,合起来才是完整的自进化闭环。

为什么我认为Meta-Harness是2026年Agent基础设施的真正拐点

LLM系统其实一直有两个零件:模型权重 + harness。过去我们把99%的精力砸在权重上,以为harness只是“辅助”。Meta-Harness第一次把harness优化本身变成了一个可自主进化的系统。这不是小修小补,而是把“让AI自己改进自己的脚手架”变成了现实。

当然它也有清晰边界:它不会凭空创造模型里没有的能力,但它能把已有能力真正释放出来。这正是当前所有自改进研究最需要的一环。

在生产环境落地Meta-Harness级自主优化前 你必须先做这三件事

  1. 先把你的当前harness全部放进一个git-style历史目录,确保agent能读到完整的trace和score。
  2. 用一个强coding model(Claude 3.7 Sonnet或同级别)作为proposer,别急着加额外约束,让它自己决定读什么历史。
  3. 每轮迭代后手动review一次agent的假设过程——这是目前最有效的“过拟合”防护,也是人类还能提供最大价值的环节。

LLM自进化的未来,不会只靠越来越大的模型,而是靠越来越聪明的harness。那些还在手动调prompt和eval的人,会慢慢发现自己永远在追模型的尾巴;而掌握Meta-Harness思路的团队,已经让AI开始自己优化自己最核心的“马具”。

你正在搭建的Agent系统里,harness优化是怎么处理的?是纯人工、summary-based,还是已经尝试过完整历史迭代?把你的方案或最大痛点发在评论区,我们一起拆解——说不定下一个被Meta-Harness彻底解锁的benchmark,就藏在你的下一个迭代里。

我是紫微AI,在做一个「人格操作系统(ZPF)」。后面会持续分享AI Agent和系统实验。感兴趣可以关注,我们下期见。

http://www.jsqmd.com/news/567558/

相关文章:

  • 探索介质超表面中的三次谐波与非线性光学
  • 智能升级:利用快马AI模型为你的电子书网站添加摘要生成与推荐
  • 阿里通义Z-Image-Turbo WebUI镜像部署:科哥二次开发版详细使用教程
  • 救命!这5款AI PPT美化工具,让我告别熬夜排版 - 品牌测评鉴赏家
  • Qwen3-14B合同审查展示:关键条款标红+风险等级评估+修订建议输出
  • 全网资源一键下载:res-downloader终极资源嗅探工具使用指南
  • 【第五周】论文精读:IRCoT:当检索增强遇上思维链,多步推理难题迎刃而解
  • Qwen3.5-2B轻量教程:关闭Flash Attention节省显存,适配4GB显卡
  • 在Java项目中使用OkHttp构建高可用的外卖霸王餐API客户端
  • Windows 10下TESLA P40显卡CUDA 12.9.1环境搭建全攻略(含Ollama-GPU配置)
  • intv_ai_mk11效果实测:在中文长文本理解任务(>3000字技术文档)中摘要准确率与人工对比达92%
  • 万象视界灵坛部署案例:GPU算力优化的开源多模态感知平台
  • 技术赋能B端拓客:号码核验行业的迭代升级与价值深耕,
  • Lychee-Rerank-MM部署案例:智慧农业病虫害图-防治方案-农技知识排序
  • 告别FuLID-Flux报错:在Ubuntu 22.04 + RTX4090环境下,从源码层面搞定insightface模型加载
  • PDF.js在React中的5个高级用法:从基础渲染到性能优化
  • Hunyuan-OCR-WEBUI新手入门:手把手教你搭建OCR识别环境
  • 如何实现丝滑拖拽交互?React-Grid-Layout高级功能开发指南
  • 基于MPC的六自由度机械臂与倒立摆及二自由度机械臂协同控制策略研究
  • OpenCV+Python纹理分割避坑指南:暗斑检测的形态学参数调优技巧
  • 终极本地语音转文字方案:AnythingLLM完全离线部署指南
  • Ubuntu下Kea DHCP Server高级配置:Option 43与日志调优实战
  • 第5章 变量类型-5.7 列表
  • dropbear交叉编译移植记录
  • 通过信道优化数据传输的通信链路的实现附Matlab代码
  • 199.Vue3 + OpenLayers 实现:点击 / 拖动地图播放音频
  • 射频电路设计中的阻抗匹配原理与实践
  • 每周一个开源项目 #6:LlamaEdge 轻量本地大模型部署工具
  • 深求·墨鉴保姆级教程:从安装到使用,打造你的个人数字文房
  • 视觉感知升维:RGB+EVS 硬件融合的新基准