HarnessTax 研究顯示,對於編碼代理而言,框架選擇主要影響成本,而非成功率
摘要
選擇不同的編碼代理框架可能使解決任務的貨幣成本差異高達五倍,但對成功率的影響微乎其微,且一個極簡的開源框架(Pi)往往與專有系統一樣有效。
HarnessTax 評估概覽
HarnessTax 項目評估了 21 組模型與框架的組合,涵蓋 七種語言模型(Claude、GPT-5 系列、Kimi K3 等)以及 三種編碼代理框架(Claude Code、Codex CLI 和開源的 Pi)。每組組合在兩個公開基準測試——SWE-bench Lite 和 Terminal-Bench 2.0——中隨機抽取的 30 個任務上運行,每個任務重複 三次 以捕捉變異性。成本以 2026 年 9 月 1 日的價格表計算的代幣美元為單位進行衡量,而成功率則使用各基準測試的官方評估器進行測量。
該研究報告了三項關鍵發現,每項發現都在下方的獨立章節中進行描述。
發現 1:框架選擇主要影響成本,而非正確性
結論: 同一個模型在不同框架中幾乎達到相同的成功率,但代幣成本可能差異高達 5 倍。
- 對於給定的模型,當更換框架時,成功率 在 SWE-bench Lite 上僅波動 ±2%,在 Terminal-Bench 2.0 上僅波動 ±5%。
- 成本比率(幾何平均值)顯示,在 SWE-bench Lite 上,Claude Code 比 Pi 貴約 2.0 倍,比 Codex 貴 1.6 倍;在 Terminal-Bench 2.0 上,Claude Code 比 Pi 貴 1.5 倍。
- 示例:Claude Fable 5 在 Claude Code 中解決了 97.8% 的嘗試,在 Codex 中解決了 96.7%,在 Pi 中解決了 96.7%,但 Claude Code 每次嘗試的成本為 1.33 美元,而 Pi 僅為 0.67 美元。
「因為使用不同的框架,為本質上相同的質量支付額外費用,就像支付了一種……框架稅 💰」 – 作者,HarnessTax。
啟示: 僅關注成功指標的使用者可能會不自覺地承擔隱藏的「框架稅」。評估時應始終比較跨框架的成本調整後性能。
發現 2:極簡框架具有競爭力
結論: 輕量級、開源的 Pi 框架——僅提供四個工具(讀取、寫入、編輯、bash)——在兩個基準測試中均達到了帕累托前沿(Pareto frontier)。
- 各框架的回合數相似(例如,在 SWE-bench Lite 上,Fable 5 在 Pi 和 Claude Code 中的平均回合數分別為 15.4 和 15.3),但 Claude Code 的每回合代幣使用量大約是 Pi 的兩倍。
- 初始上下文大小 是主要的成本驅動因素:Claude Code 的第一次模型調用包含比 Pi 多 10 倍以上 的指令和工具模式字符,這在模型輸出之前就膨脹了代幣消耗。
- 更簡單的框架在不犧牲成功率的同時減少了開銷,這表明許多任務並不嚴格需要功能豐富的專有框架特性。
「Pi 和 Codex 的有效性展示了利用現有模型進行開源框架研究的機會。」 – 作者,HarnessTax。
啟示: 開發人員可以通過構建或採用輕量級框架來實現具有成本效益的編碼輔助,特別是當安全性或對齊約束在其他地方處理時。
發現 3:模型在其原生框架之外往往表現更好
結論: 供應商特定的框架優化並不保證最佳的模型-框架組合;在 12 次跨模型比較中,替代框架在 9 次中取得了最高的成功率。
- 儘管 Anthropic 的 Claude 模型是為 Claude Code 調優的,但它们在 Codex CLI 和 Pi 中的表現相當或更好。
- OpenAI 的 GPT-5.6 Sol 在 Terminal-Bench 2.0 中,在 Pi 中取得了 83.3% 的成功率,而在 Codex 中為 78.9%,成本僅為後者的 約 50%。
- Sonnet 4.6 在 SWE-bench Lite 中,在 Codex 中解決了 68.9% 的任務,而在 Claude Code 中為 66.7%,成本相似。
「模型的能力是兼容的、可泛化的,並且可以遷移到其他框架中。」 – 作者,HarnessTax。
啟示: 實踐者應該嘗試多種框架來測試給定的模型,而不是假設供應商的默認設置是最優的。
Hacker News 上的社區反應
- 成本與穩健性: 幾位評論者指出,雖然 Pi 便宜,但由於系統提示更豐富,Claude Code 和 Codex 可能對格式錯誤的工具調用具有更高的穩健性。
- 基準測試的局限性: 用戶指出,這兩個開源基準測試可能偏袒在訓練期間見過類似數據的模型,且實際工作負載可能顯示出不同的成本-準確率權衡。
- 工具調用兼容性: 一條評論強調,使用原生工具簽名(例如 Claude 的
Edit,GPT 的apply_patch_call)對性能的影響可能大於框架本身。 - 安全考慮: 一些人認為,專有框架中的額外上下文通常包含安全指令,雖然成本較高,但對於生產環境使用可能是必需的。
- 未來方向: 討論突出了對並行框架設計、動態框架選擇以及捕捉代幣成本和穩健性的標準化基準測試的興趣。
給開發人員和研究人員的實用要點
- 測量成本,而不僅是成功率。 在評估編碼代理時,應記錄代幣美元與通過/失敗指標。
- 從輕量級框架開始。 Pi 的四工具設計表明,極簡主義對許多任務來說已經足夠;只有在需要特定的安全性或工具特性時才增加複雜性。
- 測試跨框架組合。 即使某個模型是與專有框架一起營銷的,也應通過替代方案(例如在 Codex CLI 中運行 Claude 模型)來運行它,以發現更便宜且同樣有效的配置。
- 關注初始提示的大小。 大型系統提示可能主導成本;修剪不必要的指令和工具模式可帶來立竿見影的節省。
- 預期不同工作負載之間的變異性。 報告的結果適用於 SWE-bench Lite 和 Terminal-Bench 2.0;不同領域(例如科學代碼、大規模重構)可能表現出不同的成本-準確率曲線。
未來研究方向
- 基準測試擴展: 創建更廣泛的任務套件,包括長週期和會話式工作流,以測試超出當前開源基準測試範圍的框架。
- 自動化框架選擇: 開發元代理(meta-agents),根據任務特徵和實時反饋動態選擇最具成本效益的框架。
- 安全性與成本的權衡: 量化與安全性相關的上下文(例如對齊提示)如何同時影響成本和失敗模式。
- 開源框架生態系統: 鼓勵社區為輕量級框架做出貢獻,促進跨供應商和模型的互操作性。
引用
如果您在作品中使用了 HarnessTax 的結果,請引用:
@misc{pan2026harnesstax,
title = {{HarnessTax: How Much Does Harness Matter for Coding Agents?}},
author = {Pan, Melissa Z. and Yang, Shuo and Arabzadeh, Negar and Chiang, Wei-Lin and Stoica, Ion and Zaharia, Matei},
year = {2026},
url = {https://harnesstax.github.io/},
}
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch