FrontierHarness Eval: AI 코딩 하네스 벤치마킹
하네스 선택이 AI 코딩 성능에 미치는 영향
FrontierHarness Eval은 "하네스"—LLM을 둘러싼 실행 환경, 도구 세트, 그리고 오케스트레이션 레이어—가 성능과 비용의 결정적인 요인임을 보여줍니다. 동일한 모델(Kimi K3)을 12가지 서로 다른 구성으로 테스트한 통제된 실험에서, 소프트웨어 엔지니어링 작업의 통과율(pass rate)은 50%에서 66.7%까지 다양하게 나타났으며, 작업당 중앙값 비용은 $1.05에서 $18.34 사이로 나타나, 동일한 기반 지능을 사용함에도 불구하고 지출액에서 17배의 차이가 발생했습니다.
성능 및 비용 리더보드
이번 평가는 동일한 소프트웨어 엔지니어링 작업에 대해 12가지 구성에서 9개의 하네스를 테스트했습니다. 결과는 품질, 비용, 속도 사이의 급격한 차이를 보여줍니다.
품질 및 통과율
Codex가 66.7%의 통과율로 품질 리더로 나타났으며, Claude Code와 DSH Creator가 각각 63.3%로 그 뒤를 이었습니다.
- 최고 통과율: Codex (66.7%)
- 중간 범위: Pi, DSH PTC, 및 DSH Standard (60.0%)
- 최저 통과율: Hermes 및 OpenCode (50.0%)
비용 효율성
비용은 하네스가 턴(turn)과 도구 호출(tool calls)을 관리하는 효율성에 따라 크게 달라집니다. Exo Harness는 전체 작업 지출 측면에서 전반적인 비용 리더이며, OpenCode는 성공적인 작업당 가장 낮은 중앙값 비용을 보여줍니다.
- 작업당 최저 중앙값 비용: Exo Harness ($1.0452)
- 작업당 최고 중앙값 비용: Claude Code ($18.3368)
- 성공적인 작업당 최저 중앙값 비용: OpenCode ($0.0615)
실행 속도
속도는 성공적인 작업을 완료하는 데 걸리는 중앙값 시간으로 측정됩니다. DSH Minimal이 가장 빠른 구성입니다.
- 속도 리더: DSH Minimal (5m 41s)
- 최저 속도: Claude Code (9m 38s)
기술적 방법론
결과가 모델의 변동성이나 환경 노이즈가 아닌 하네스의 역량에 근거하도록 하기 위해, 평가는 엄격한 통제 프로토콜을 사용했습니다:
- 모델 일관성: 모든 실행은 Kimi K3 모델을 사용했습니다.
- 환경 격리: 모든 360회의 테스트는 Runta에서 새로운 체크포인트 복구(checkpoint restore)를 통해 시작되어, 동일한 vCPU, 메모리, 디스크 크기, 디스크 내용, 그리고 메모리 상태를 보장했습니다.
- Cold Start: 워밍업된 캐시 편향(warm-cache bias)을 방지하기 위해 모든 실행은 새로운 복구 상태에서 시작되었습니다.
- 집중 분야: 벤치마크는 소프트웨어 엔지니어링 컨텍스트와 터미널 기반 작업에 구점을 맞추고 있습니다.
주요 기술적 통찰
품질과 비용의 괴리
높은 통과율이 반드시 낮은 비용으로 이어지지는 않습니다. 예를 들어, Claude Code는 높은 통과율(63.3%)을 달성했지만 작업당 가장 높은 비용($18.34)이 발생했습니다. 이는 더 철저하거나 비용이 많이 드는 오케스트레이션 전략을 사용하여 더 자주 성공하지만 더 높은 가격을 지불해야 함을 시사합니다.
캐시 히트율 vs 실제 비용
Codex와 Kimi Code는 가장 높은 중앙값 캐시 히트율(88.0%)을을 보여주었지만, 평가는 캐시 히트율이 비용의 직접적인 대리 지표가 아님을 언급합니다. 캐시된 300턴의 길고 실패하는 시퀀스가 캐시를 사용하지 않는 짧은 시퀀스보다 더 비싼 비용이 발생할 수 있기 때문입니다.
커뮤니티 분석 및 반론
Hacker News의 기술 사용자들 사이의 토론론은 벤치마크에 대한 몇 가지 주의 사항과 잠재적 편향을 강조했습니다:
- 모델-하네스 결합: 일부 사용자들은 Kimi K3만을 대상으로 테스트한 것이 결과를 왜곡할 수 있다고 주장했습니다. 한 사용자는 일부 하네스가 특정 모델의 특성(예: Kimi의 도구 호출 루프 경향)에 최적화되어 있다고 언급하며, Kimi에서 뛰어난 성능을 것을서는 Claude나 GPT 모델을 사용할 때만큼 성능이 성능이 좋을지 알 수 수 없습니다.
- 통계적 유의성: 비판론자들은 하네스당 30개의 샘플만 사용했기 때문에 정확도에 대한 신뢰 구간이 너무 넓어 상위권 성능자를 확정적으로 순위위를 랭크할 수 없다고 지적했습니다.
- 중앙값 vs 평균: 일부 관찰자들은 중앙값 비용 대신 평균 비용을 사용하지 않으면 실제 재정적 영향을 과소평가할 수 있다고 지적했습니다. 몇몇 매우 비싼 실패한 실행이 평균을 크게 상승시킬 수 있기 때문입니다.
- 하네스 비대화(Harness Bloat): Pi (60% 통과율)와 같은 미니멀 하네스의 높은 성능은 많은 복잡한 하네스들이 불필요하게 비대해져 있을 수 있음을 시사합니다.
"As models become commodities, the harness will be the next optimizing game."
"Testing it against Kimi is potentially skewing the numbers massively... Harnesses built to deal with e.g. Anthropic's models primarily, do not need to deal with that."
테스트된 하네스 버전
| Harness | Version |
|---|---|
| Codex | v0.148.0 |
| DeepSeek Harness (DSH) | v0.1.0-rc.8 |
| Claude Code | v2.1.237 |
| Pi | v0.84.2 |
| Oh My Pi | v17.4.0 |
| Kimi Code | v0.37.2 |
| Exo Harness | v0.1.0 |
| OpenCode | v1.18.19 |
| Hermes | v0.20.4 |
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch