Better Harness:让 AI 编程 Agent 越用越好
用 AI Agent 写代码的人越来越多,但有个问题一直没解决好:Agent 干完活,你怎么知道它干对了?
代码能跑不代表验证充分,"It works" 不等于有证据。更麻烦的是,同一个项目里 Agent 反复踩同一个坑,上次犯的错这次接着犯,经验没有被沉淀下来。
QoderAI/better-harness 就是冲着这个问题来的。
项目地址:https://github.com/QoderAI/better-harness
目前 1400+ Star、100+ Fork,MIT 协议。它的定位一句话说清楚:把代码交给 Agent,改善 Agent 周围的工作循环。
它解决什么问题
Better Harness 的作者总结了 AI 编程工作流里五个常见毛病:
- 目标模糊——Agent 自信满满地解错了题
- 步骤随意——工作路径不可复现
- "能跑"无证据——验证不完整或缺失
- 速度压过安全——跳过审查和交付检查
- 教训流失——同样的摩擦在不同任务里反复出现
这些问题不是某个 Agent 的 bug,而是工作流设计的问题。Better Harness 不改 Agent 本身,而是分析 Agent 工作时产生的证据,找出循环里的薄弱环节,给出可验证的改进建议。
核心概念:Agent Work Loop
Better Harness 的核心是一个叫 "Agent Work Loop" 的评估模型,从五个维度审视 AI 编程工作流:
| 维度 | 回答的问题 | 证据来源 |
|---|---|---|
| 任务理解 | Agent 是否清楚目标和完成标准? | 规则文件、AGENTS.md、规格说明、DESIGN.md |
| 受控执行 | 工作是否在受支持的、可复现的路径上? | Skills、命令、MCP 工具、沙箱边界 |
| 变更验证 | 是否有证据证明改动能用? | 测试、lint、Hooks、可观测诊断 |
| 可靠交付 | AI 的速度是否绕过了质量检查? | 人工审查、审批、CI/CD、回滚路径 |
| 学习沉淀 | 下一个任务能受益吗? | 循环发现、可复用 SDLC Skills、记忆 |
这个模型用的是前馈+反馈的思路:前馈引导(AGENTS.md、规格、Skills、验收标准)在 Agent 行动之前指方向;反馈传感器(linter、测试、Hooks、评估 Agent)观察结果,帮 Agent 自我纠正。
一个关键原则是对证据诚实:没观察到的东西就明确标注为缺失,不会脑补成分数或结论。这比那些假装什么都能打分的工具靠谱。
怎么用
Better Harness 不是独立运行的工具,而是作为插件装到你正在用的编程 Agent 里。目前支持 8 个 host:
- Claude Code
- Codex Desktop
- Codex CLI
- Qoder(桌面和 CLI)
- Cursor
- GitHub Copilot CLI
- Qwen Code
- Pi
以 Claude Code 为例:
# 1. 注册 marketplace
/plugin marketplace add QoderAI/better-harness# 2. 安装插件
/plugin install better-harness@better-harness# 3. 验证
claude plugin details better-harness@better-harness# 4. 运行分析
/better-harness analyze this project's AI coding workflow and generate an evidence-backed report
跑完之后会在 .claude/better-harness 目录下生成三个文件:
- report.html——自包含的可视化报告
- report.md——配对的 Markdown 版本
- findings.json——结构化的发现数据
不同 host 的安装和调用方式略有不同,但核心流程一样:装插件 → 跑分析 → 看报告。
报告里有什么
生成的报告不是一堆笼统的建议,而是有结构的:
1. 五维度概览
对 Agent Work Loop 的五个维度各给一个评估,让你一眼看到哪块强、哪块弱。
2. 优先级排序的发现
每条发现都包含:
- 影响程度(impact)
- 预期产出(expected output)
- 范围明确的修复方案(scoped repair)
- 验收检查(acceptance checks)
修复方案是草拟好的、可以直接拿去 review 的,不是"建议你加强测试"这种废话。
3. 检测到的 Agent 资产
自动发现项目里已有的 AGENTS.md、Skills、Hooks、MCP 配置等。
4. 证据摘要
每条结果都保留了可见的证据来源、归属者和验证路径。缺失或部分缺失的证据会明确标注,不会拿没观察到的东西充数。
5. 历史趋势
多次运行后可以看到五个维度随时间的变化趋势。这里有个诚实的声明:历史视图展示的是"记录的趋势",不是"改善的因果证明"。只有可比较的后续结果才能证明循环确实改善了。
架构设计
Better Harness 的架构有三个特点值得注意:
三个证据域独立
任务证据、项目 Harness 证据、Agent 自定义证据三个域独立收集,最后由 lead agent 统一分析。每个结果都保留可见的证据来源、归属者和验证路径。
三层开放
- 工程实践层:Session Evidence、Project Harness、Agent Customize、Loop Engineering 的证据/判断指导
- 评估模型层:Agent Work Loop 的证据状态、发现、评分边界、纵向验证
- 可运行实现层:
/better-harness工作流、证据收集器、分析器、渲染器、host 适配器
没有统一入口
每个 host 有自己的安装和调用路径,没有搞一个"万能入口"。这比较务实,因为不同 Agent 的插件体系差异很大。
适合什么场景
1. 团队用 AI Agent 做开发
如果团队里多人用 Agent 写代码,质量参差不齐,Better Harness 能帮你建立一套统一的评估标准,找出谁的工作流需要改进。
2. 想系统提升 Agent 效果
不只是让 Agent 写更多代码,而是让每次任务都比上次做得好。学习沉淀维度专门解决"教训流失"的问题。
3. 需要证据驱动的人
如果你不满足于"Agent 说搞定了",而是要有证据证明搞定了,这个工具的变更验证维度正合适。
4. 用多个 Agent 的人
支持 8 个 host,如果你在不同场景用不同 Agent(比如 Claude Code 写代码、Copilot 做辅助),Better Harness 能用同一套模型评估它们。
和同类思路对比
Better Harness 比较特别,它不是传统的代码质量工具,也不是 Agent 本身。它处在两者之间——评估 Agent 的工作过程。
| 对比维度 | Better Harness | 传统 lint/测试工具 | Agent 本身(Claude Code 等) |
|---|---|---|---|
| 评估对象 | Agent 工作循环 | 代码质量 | 写代码 |
| 证据来源 | 会话证据 + 项目资产 | 代码本身 | 不评估自己 |
| 改进方向 | 工作流和循环设计 | 代码规范 | 不适用 |
| 纵向追踪 | 有(历史趋势) | 有 | 无 |
| 跨 Agent 支持 | 8 个 host | 与 Agent 无关 | 各自独立 |
它的独特价值在于:不替代任何工具,而是填补了"谁来评估 Agent 的工作方式"这个空白。
想参与开发
项目用 Node.js,环境要求 Node.js ≥ 22.20.0,npm ≥ 10.9.3。
git clone https://github.com/QoderAI/better-harness.git
cd better-harness
npm ci # 安装依赖
npm test # 跑测试
npm run pack:verify # 验证打包
几个有用的命令:
# 不读本地会话,只检查仓库证据
node scripts/better-harness.mjs report --no-sessions# 构建 Codex 插件产物
node scripts/packaging/build-host-plugin.mjs# 预览内置 fixture
npm run preview -- --open
贡献按领域分工:工作流指导放 skills/ 或 references/,评估模型放 models/ 或 scripts/,交付控制和 host 支持放 hooks/,报告和视觉语言放 templates/,示例放 case-studies/。
一些观察
1. 定位独特。AI 编程工具大多关注"让 Agent 更强",Better Harness 关注"让 Agent 的工作方式更可验证、更可持续"。这个角度目前没什么竞品。
2. 证据诚实原则值得学习。没观察到就标注缺失,不脑补分数。这种态度在 AI 工具里不多见,很多工具倾向于给一个看起来很厉害但实际没根据的评分。
3. 多 host 支持是优势也是负担。支持 8 个 host 意味着覆盖面广,但每个 host 的适配维护成本不低。目前 6 个在 Quickstart 里验证过,Pi 和 WorkBuddy 还是适配支持阶段。
4. 纵向验证的思路很对。单次评估只能说明"当前状态",只有可比的后续结果才能证明"确实改善了"。Better Harness 的历史趋势视图就是为这个设计的。
5. 1400+ Star 说明需求真实存在。用 AI Agent 做开发的人越来越多,"怎么知道 Agent 干对了"这个问题会越来越重要。Better Harness 给了一个体系化的答案。
总结
Better Harness 做的事可以用一句话概括:它不帮你写代码,它帮你搞清楚 Agent 写代码的方式哪里能改进。
如果你在用 AI Agent 做开发,并且想系统性地提升工作质量而不是碰运气,这个项目值得试试。装个插件跑一次分析,看看报告里指出的薄弱环节是不是你平时隐约感觉到但说不清楚的那些问题。
文档地址:https://qoderai.github.io/better-harness/
项目地址: https://github.com/QoderAI/better-harness
Stars: ⭐ 1.4k
Forks: 109
语言: JavaScript / Node.js
许可证: MIT
作者: itech001
来源: 公众号:AI人工智能时代
网站: https://www.theaiera.cn/
每日分享最前沿的AI新闻资讯和技术研究。
