FrontierHarness Eval: Benchmarking AI Coding Harnesses
The Impact of Harness Selection on AI Coding Performance
FrontierHarness Eval 证明了“harness”(即围绕 LLM 的执行环境、工具集和编排层)是决定性能和成本的关键因素。在针对相同模型 (Kimi K3) 进行 12 种不同配置的受控测试中,软件工程任务的通过率在 50% 到 66.7% 之间波动,而每个任务的中位数成本在 $1.05 到 $18.34 之间,这意味着在相同的底层智能水平下,支出差异高达 17 倍。
Performance and Cost Leaderboard
本次评估测试了 9 种 harness 在 12 种配置下的相同软件工程任务。结果突显了质量、成本和速度之间的剧烈分歧。
Quality and Pass Rates
Codex 在质量方面处于领先地位,通过率为 66.7%,紧随其后的是 Claude Code 和 DSH Creator,两者均为 63.3%。
- Highest Pass Rate: Codex (66.7%)
- Mid-Range: Pi, DSH PTC, and DSH Standard (60.0%)
- Lowest Pass Rate: Hermes and OpenCode (50.0%)
Cost Efficiency
成本因 harness 在管理轮次 (turns) 和工具调用 (tool calls) 方面的效率而异。Exo Harness 在总任务支出方面是整体成本领先者,而 OpenCode 在每个成功任务的中位数成本最低。
- Lowest Median Cost per Task: Exo Harness ($1.0452)
- Highest Median Cost per Task: Claude Code ($18.3368)
- Lowest Median Cost per Successful Task: OpenCode ($0.0615)
Execution Speed
速度通过完成一个成功任务的中位数时间来衡量。DSH Minimal 是最快的配置。
- Speed Leader: DSH Minimal (5m 41s)
- Slowest: Claude Code (9m 38s)
Technical Methodology
为了确保结果是基于 harness 的能力而非模型差异或环境噪声,评估采用了严格的控制协议:
- Model Consistency: 每一个运行实例均使用 Kimi K3 模型。
- Environment Isolation: 所有 360 次试验均从 Runta 上的一个全新的 checkpoint restore 开始,确保了完全相同的 vCPU、内存、磁盘大小、磁盘内容和内存状态。
- Cold Start: 每次运行都从全新的 restore 开始,以防止暖缓存 (warm-cache) 偏差。
- Focus: 该基准测试专门针对软件工程上下文和基于终端的任务。
Key Technical Insights
The Divergence of Quality and Cost
高通过率并不与低成本线性相关。例如,Claude Code 实现了高通过率 (63.3%),但每个任务的成本最高 ($18.34),这表明其采用了一种更详尽或更昂贵的编排策略,虽然成功率更高,但价格也更高。
Cache Hit Rates vs. Actual Cost
虽然 Codex 和 Kimi Code 显示出最高的的中位数缓存命中率 (88.0%),但评估指出,缓存命中率并不是成本的直接代理指标。一个长达 300 轮且失败的、被缓存的序列仍然可能比一个未命中缓存的短序列更贵。
Community Analysis and Counterpoints
Hacker News 上技术用户的讨论突显了该基准测试中的几个注意事项和潜在偏差:
- Model-Harness Coupling: 一些用户认为仅针对 Kimi K3 进行测试可能会使结果产生偏差。一位用户指出,某些 harness 专门针对特定模型的特性(例如 Kimi 的工具调用循环倾向)进行了优化,而一个在 Kimi 上表现出色的 harness 可能在 Claude 或 GPT 上表现不佳。
- Statistical Significance: 批评者指出,由于每个 harness 仅有 30 个样本,准确率的置信区间可能过宽,无法明确地对顶尖表现者进行排名。
- Median vs. Mean: 一些观察者指出,使用中位数成本而非平均成本可能会低估实际的财务影响,因为几次极高成本的失败运行可能会显著拉高平均值。
- Harness Bloat: Pi (60% 通过率) 等极简 harness 的高性能表现,使得一些人建议许多复杂的 harness 可能存在不必要的臃肿。
"As models become commodities, the harness will be the next optimizing game."
"Testing it against Kimi is potentially skewing the numbers massively... Harnesses built to deal with e.g. Anthropic's models primarily, do not need to deal with that."
Tested Harness Versions
| Harness | Version |
|---|---|
| Codex | v0.148.0 |
| DeepSeek Harness (DSH) | v0.1.0-rc.8 |
| Claude Code | v2.1.237 |
| Pi | v0.84.2 |
| Oh My Pi | v17.4.0 |
| Kimi Code | v0.37.2 |
| Exo Harness | v0.1.0 |
| OpenCode | v1.1.0 |
| Hermes | v0.20.4 |
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch