Better Harness – 阿里云开源的面向编程Agent分析与持续改进工具

Better Harness是由阿里云Qoder开源的面向编程Agent工作流的开源分析与持续改进工具,通过工程化手段验证Agent实际能力而非配置参数,确保AI生成代码的可靠性与可追溯性。其本质是一套连接Harness Engineering(驾驭工程)与Loop Engineering(循环工程)的实践框架,专为解决编程Agent在真实项目中“配置看似合理但任务实际失败”的痛点而设计。

Better Harness - 阿里云开源的面向编程Agent分析与持续改进工具

Better Harness核心定义

1. 与普通Harness的区别

  • 不依赖静态配置
    传统Harness仅检查Agent是否调用工具或读取规则文件,而Better Harness必须验证Agent是否真正使用能力完成任务(例如:不仅要求Agent调用测试命令,还需确认测试通过)。
  • 证据驱动闭环
    每项问题发现(Finding)均需附带可追溯的会话证据、用户影响范围、修复边界及验证方式,避免主观判断。

2. 适配范围

  • 兼容主流编程Agent
    支持Claude CodeCodex、Qoder、Cursor等工具链,不绑定特定模型
  • 聚焦工程落地
    针对性解决Agent在真实项目中的任务漂移、工具误用、结果不可验证三大核心问题。

Better Harness技术原理

1. Harness Engineering实践层

  • 会话级验证
    通过Session Evidence还原Agent实际行为(工具调用链、失败重试逻辑、上下文消耗),而非仅依赖日志声明
  • 项目级防护
    基于Project Harness检查项目是否提供可靠执行路径(如CI/CD配置、敏感操作拦截机制),确保环境一致性
  • Agent资产治理
    通过Agent Customize验证规则、技能库等资产是否被有效调用,避免“配置存在但未生效”
Better Harness - 阿里云开源的面向编程Agent分析与持续改进工具

2. 评估模型层

  • 动态证据边界
    设定严格证据阈值(如必须包含测试通过日志、代码变更快照),拒绝模糊结论(例如:“Agent声称完成但未运行测试”不被认可)。
  • 跨模型对照评测
    对同一任务使用多模型(Claude/Codex/Qoder)独立运行并交叉验证,消除模型个体偏差。
Better Harness - 阿里云开源的面向编程Agent分析与持续改进工具

3. 可运行工程实现层

  • 自动化证据采集
    一键冻结任务范围,自动捕获三类证据(会话记录、项目配置、Agent定制参数),生成HTML/Markdown可读报告。
  • 修复闭环设计
    明确标注修复责任人(长期由Rule/Skill承载,临时由人工介入),避免问题重复发生
Better Harness - 阿里云开源的面向编程Agent分析与持续改进工具

Better Harness核心特点

1. 证据纪律优先

  • 拒绝“自我宣称”
    Agent输出“Done!”但未通过测试,系统直接判定任务失败
  • 证据链强制关联
    每个结论必须引用具体时间戳、命令输出或代码片段,杜绝推测性描述

2. 工程化持续改进

  • 问题归因到责任人
    区分需模型优化(如提示词缺陷)、需规则补充(如新增工具限制)或需流程改造(如强制测试步骤)。
  • 修复效果可量化
    通过复跑验证确认问题是否根治,避免临时补丁导致新漏洞

3. 轻量级集成

  • 非侵入式部署
    通过CLI或插件接入现有工作流,无需重构项目结构
  • 最小化配置
    仅需定义任务边界、证据规则及验证命令,5分钟内完成基础配置

Better Harness核心功能

1. 任务可靠性验证

  • 能力使用检查
    监测Agent是否实际调用关键工具(如lint检查、依赖冻结),而非仅声明支持。
  • 结果有效性确认
    强制要求测试/构建命令退出码为0,否则标记任务未完成。

2. 问题深度归因

  • 证据导向报告
    自动关联会话行为、项目配置与Agent定制参数,定位根本原因(例如:因未读取.gitignore导致误删文件)。
  • 影响范围标注
    明确标注问题影响的用户场景、修复成本及紧急程度(如“阻塞主干分支合并”)。

3. 持续改进闭环

  • 修复路径指引
    提供具体修改建议(如“在AGENTS.md中补充依赖版本锁规则”)及验证方式。
  • 历史问题防复发
    将已修复问题沉淀为自动化检查规则,后续任务自动拦截同类错误。

Better Harness项目地址

  • Better Harness 的 GitHub 仓库:https://github.com/QoderAI/better-harness


Better Harness应用场景

1. 编程Agent质量管控

  • 代码生成可靠性验证
    确保Agent生成的代码不仅通过编译,还需通过项目级测试,避免“本地能跑、CI崩溃”。
  • 敏感操作防护
    自动拦截Agent的高危命令(如rm -rfgit push --force),强制人工确认

2. 工程效能提升

  • 减少无效调试
    通过证据报告快速定位是Agent能力缺陷还是环境配置问题,节省70%+排查时间。
  • 标准化能力沉淀
    将零散的修复经验转化为可复用的Rule/Skill(如“所有前端任务必须运行ESLint”)。

3. 企业级Agent治理

  • 合规审计支持
    完整记录任务执行链路与决策依据,满足金融、医疗等行业的强监管要求。
  • 能力边界可视化
    通过历史证据库量化评估Agent在不同项目中的可靠性,指导任务分配策略。

Better Harness将编程Agent的“黑盒执行”转化为可验证、可追溯、可持续改进的工程实践。它不追求提升模型本身的推理能力,而是通过严格的证据纪律和闭环修复机制,确保现有能力在真实场景中稳定落地。对于企业级AI开发,其意义在于:当主流模型推理能力趋近时,决定Agent能否投入生产的关键,已从“模型多强”转向“Harness多可靠”。当前版本已支持GitHub项目一键评测,开发者可通过开源仓库快速验证其在自身项目中的适用性。

© 版权声明
为这篇文章评分
10.0/ 10
2 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...