Better Harness是由阿里云Qoder开源的面向编程Agent工作流的开源分析与持续改进工具,通过工程化手段验证Agent实际能力而非配置参数,确保AI生成代码的可靠性与可追溯性。其本质是一套连接Harness Engineering(驾驭工程)与Loop Engineering(循环工程)的实践框架,专为解决编程Agent在真实项目中“配置看似合理但任务实际失败”的痛点而设计。

Better Harness核心定义
1. 与普通Harness的区别
- 不依赖静态配置:
传统Harness仅检查Agent是否调用工具或读取规则文件,而Better Harness必须验证Agent是否真正使用能力完成任务(例如:不仅要求Agent调用测试命令,还需确认测试通过)。 - 证据驱动闭环:
每项问题发现(Finding)均需附带可追溯的会话证据、用户影响范围、修复边界及验证方式,避免主观判断。
2. 适配范围
- 兼容主流编程Agent:
支持Claude Code、Codex、Qoder、Cursor等工具链,不绑定特定模型。 - 聚焦工程落地:
针对性解决Agent在真实项目中的任务漂移、工具误用、结果不可验证三大核心问题。
Better Harness技术原理
1. Harness Engineering实践层
- 会话级验证:
通过Session Evidence还原Agent实际行为(工具调用链、失败重试逻辑、上下文消耗),而非仅依赖日志声明。 - 项目级防护:
基于Project Harness检查项目是否提供可靠执行路径(如CI/CD配置、敏感操作拦截机制),确保环境一致性。 - Agent资产治理:
通过Agent Customize验证规则、技能库等资产是否被有效调用,避免“配置存在但未生效”。

2. 评估模型层
- 动态证据边界:
设定严格证据阈值(如必须包含测试通过日志、代码变更快照),拒绝模糊结论(例如:“Agent声称完成但未运行测试”不被认可)。 - 跨模型对照评测:
对同一任务使用多模型(Claude/Codex/Qoder)独立运行并交叉验证,消除模型个体偏差。

3. 可运行工程实现层
- 自动化证据采集:
一键冻结任务范围,自动捕获三类证据(会话记录、项目配置、Agent定制参数),生成HTML/Markdown可读报告。 - 修复闭环设计:
明确标注修复责任人(长期由Rule/Skill承载,临时由人工介入),避免问题重复发生。

Better Harness核心特点
1. 证据纪律优先
- 拒绝“自我宣称”:
Agent输出“Done!”但未通过测试,系统直接判定任务失败。 - 证据链强制关联:
每个结论必须引用具体时间戳、命令输出或代码片段,杜绝推测性描述。
2. 工程化持续改进
- 问题归因到责任人:
区分需模型优化(如提示词缺陷)、需规则补充(如新增工具限制)或需流程改造(如强制测试步骤)。 - 修复效果可量化:
通过复跑验证确认问题是否根治,避免临时补丁导致新漏洞。
3. 轻量级集成
- 非侵入式部署:
通过CLI或插件接入现有工作流,无需重构项目结构。 - 最小化配置:
仅需定义任务边界、证据规则及验证命令,5分钟内完成基础配置。
Better Harness核心功能
1. 任务可靠性验证
- 能力使用检查:
监测Agent是否实际调用关键工具(如lint检查、依赖冻结),而非仅声明支持。 - 结果有效性确认:
强制要求测试/构建命令退出码为0,否则标记任务未完成。
2. 问题深度归因
- 证据导向报告:
自动关联会话行为、项目配置与Agent定制参数,定位根本原因(例如:因未读取.gitignore导致误删文件)。 - 影响范围标注:
明确标注问题影响的用户场景、修复成本及紧急程度(如“阻塞主干分支合并”)。
3. 持续改进闭环
- 修复路径指引:
提供具体修改建议(如“在AGENTS.md中补充依赖版本锁规则”)及验证方式。 - 历史问题防复发:
将已修复问题沉淀为自动化检查规则,后续任务自动拦截同类错误。
Better Harness项目地址
Better Harness 的 GitHub 仓库:https://github.com/QoderAI/better-harness
Better Harness应用场景
1. 编程Agent质量管控
- 代码生成可靠性验证:
确保Agent生成的代码不仅通过编译,还需通过项目级测试,避免“本地能跑、CI崩溃”。 - 敏感操作防护:
自动拦截Agent的高危命令(如rm -rf、git push --force),强制人工确认。
2. 工程效能提升
- 减少无效调试:
通过证据报告快速定位是Agent能力缺陷还是环境配置问题,节省70%+排查时间。 - 标准化能力沉淀:
将零散的修复经验转化为可复用的Rule/Skill(如“所有前端任务必须运行ESLint”)。
3. 企业级Agent治理
- 合规审计支持:
完整记录任务执行链路与决策依据,满足金融、医疗等行业的强监管要求。 - 能力边界可视化:
通过历史证据库量化评估Agent在不同项目中的可靠性,指导任务分配策略。
Better Harness将编程Agent的“黑盒执行”转化为可验证、可追溯、可持续改进的工程实践。它不追求提升模型本身的推理能力,而是通过严格的证据纪律和闭环修复机制,确保现有能力在真实场景中稳定落地。对于企业级AI开发,其意义在于:当主流模型推理能力趋近时,决定Agent能否投入生产的关键,已从“模型多强”转向“Harness多可靠”。当前版本已支持GitHub项目一键评测,开发者可通过开源仓库快速验证其在自身项目中的适用性。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



