QoderAI/better-harness

An open-source Harness Engineering platform for coding agents—define harnesses as code, run controlled experiments, inspect evidence, and compare outcomes.

它解决了什么问题

AI 编码代理的运行速度常常超过其周围工作流程的处理能力,导致目标模糊、无法复现的临时步骤,以及缺乏证明变更确实有效的证据。Better Harness 通过分析代码变更周围的工作流程,而非仅仅关注最终输出,来识别并优先处理 AI 编码过程中的缺口,从而解决这些系统级问题。

它如何工作

Better Harness 使用前馈与反馈循环,从五个维度评估「代理工作循环」:

  1. 任务理解:检查代理是否理解目标以及「完成」的定义,依据规则、规范和设计文档。
  2. 受控执行:确保工作遵循可重复的路径,通过技能、命令和沙箱边界实现。
  3. 变更验证:寻找证据(测试、代码检查工具、诊断信息)证明变更有效。
  4. 可靠交付:验证质量检查和人工评审未被绕过。
  5. 学习捕获:确保从一项任务中获得的经验能通过记忆和可复用技能惠及未来任务。

它作为插件集成到多种编码代理(如 Claude Code、Cursor、Codex 和 GitHub Copilot)中,生成基于证据的报告(HTML 或 Markdown 格式),突出显示优先级发现,并提出范围明确的修复计划。

适用对象

希望超越审查代码差异,优化整个 AI 辅助开发生命周期的开发者和团队。

主要亮点

  • 多主机支持:兼容多种代理,包括 Claude Code、Cursor、Codex、GitHub Copilot、Qwen Code 等。
  • 基于证据的分析:明确追踪观察到的内容与缺失内容,避免无依据的评分或声明。
  • 可操作的发现:将缺口转化为优先级发现,包含影响评估、预期输出和范围明确的修复计划。
  • 可视化报告:提供 HTML 报告和「Harness Inspector」,用于追踪交付过程和代理活动。

相关