FrontierHarness Eval: Benchmarking AI Coding Harnesses
選擇 Harness 對 AI 編碼性能的影響
FrontierHarness Eval 證明了「harness」——即圍繞 LLM 的執行環境、工具集和編排層——是決定性能和成本的關鍵因素。在一個使用相同模型 (Kimi K3) 並跨越 12 種不同配置的受控測試中,軟體工程任務的通過率從 50% 到 66.7% 不等,而每個任務的中位數成本從 $1.05 到 $18.34 不等,這代表在相同的底層智能水平下,支出存在 17 倍的差異。
性能與成本排行榜
該評估在相同的軟體工程任務上,針對 12 種配置測試了 9 種 harness。結果突顯了品質、成本和速度之間的劇烈分歧。
品質與通過率
Codex 出現為品質領導者,通過率為 66.7%,其次是 Claude Code 和 DSH Creator,兩者皆為 63.3%。
- 最高通過率: Codex (66.7%)
- 中等範圍: Pi, DSH PTC, 和 DSH Standard (60.0%)
- 最低通過率: Hermes 和 OpenCode (50.0%)
成本效率
成本因 harness 管理輪次 (turns) 和工具調用 (tool calls) 的效率而有顯著差異。Exo Harness 是總任務支出的整體成本領導者,而 OpenCode 在每個「成功」任務的中位數成本最低。
- 最低任務中位數成本: Exo Harness ($1.0452)
- 最高任務中位數成本: Claude Code ($18.3368)
- 最低成功任務中位數成本: OpenCode ($0.0615)
執行速度
速度是以完成一個成功任務的中位數時間來衡量的。DSH Minimal 是最快的配置。
- 速度領導者: DSH Minimal (5m 41s)
- 最慢: Claude Code (9m 38s)
技術方法論
為了確保結果是基於 harness 的能力而非模型差異或環境雜訊,該評估採用了嚴格的控制協議:
- 模型一致性: 每次運行都使用 Kimi K3 模型。
- 環境隔離: 所有 360 次試驗均從 Runta 上的全新檢查點還原 (checkpoint restore) 開始,確保了相同的 vCPU、記憶體、磁碟大小、磁碟內容和記憶體狀態。
- 冷啟動: 每次運行都以全新的還原開始,以防止暖快取 (warm-cache) 偏差。
- 重點: 基準測試專門針對軟體工程情境和基於終端機的任務。
關鍵技術洞察
品質與成本的分歧
高通過率並不與低成本線性相關。例如,Claude Code 實現了高通過率 (63.3%),但產生了最高的任務中位數成本 ($18.34),這表明其採用了更詳盡或更昂貴的編排策略,雖然成功率更高,但價格也更高。
快取命中率 vs. 實際成本
雖然 Codex 和 Kimi Code 顯示出最高的中位數快取命中率 (88.0%),但評估指出,快取命中率並非成本的直接指標。一個長且失敗的 300 輪次序列,即使被快取,其成本仍可能比一個未命中快取的短序列更貴。
Bagged: ["As models become commodities, the harness will be the next optimizing game."]
"As models become commodities, the harness will be the next optimizing game."
"Testing it against Kimi is potentially skewing the numbers massively... Harnesses built to deal with e.g. Anthropic's models primarily, do not need to deal with that."
測試過的 Harness 版本
| Harness | Version |
|---|---|
| Codex | v0.148.0 |
| DeepSeek Harness (DSH) | v0.1.0-rc.8 |
| Claude Code | v2.1.237 |
| Pi | v0.84.2 |
| Oh My Pi | v17.4.0 |
| Kimi Code | v0.37.2 |
| Exo Harness | v0.1.0 |
| OpenCode | v1.18.19 |
| Hermes | v0.20.4 |
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch