Claude Fable 5 vs. GPT‑5.6 Sol on KIRO NP‑Hard Fiber Network Benchmark
Claude Fable 5 vs. GPT‑5.6 Sol on KIRO NP‑Hard Fiber Network Benchmark
TL;DR
Claude Fable 5는 KIRO 광섬유 네트워크 벤치마크에서 전체적으로 가장 좋은 솔루션을 만들었으며, 그 결과는 GPT‑5.6 Sol보다 훨씬 일관되었습니다. 기본 /goal 플래그는 대부분의 개별 실행에서 도움이 되었지만 두 모델 모두의 평균 점수를 높였으며, /goal이 신뢰할 수 있는 일반적인 “더 열심히 시도” 스위치가 아님을 보여줍니다.
The KIRO Problem
이 벤치마크는 2018 해커톤에서 학생들에게 제시된 KIRO라는 운영‑연구 과제입니다. 해결자는 세 개의 프랑스 도시(그르노블, 니스, 파리)를 위한 광섬유 네트워크를 설계해야 하며, 배포 허브와 터미널을 루프와 짧은 가지로 연결하면서 구조적 제약을 만족시켜야 합니다. 목표는 총 케이블 길이를 최소화하는 것입니다.
Search‑space magnitude
- 순서와 가지를 무시하고 532개의 터미널 각각을 11개의 허브 중 하나에 할당하면
11^532개의 경우가 가능합니다. - 솔루션을 정확히 19개의 루프(각 루프에 28개의 터미널)로 제한하면(가지 없음) 대략
10^1223개의 유효한 구성이 하한으로 남습니다.
이 수치들은 문제를 NP‑hard하게 만드는 조합 폭발을 보여줍니다.
Experimental Setup
| Parameter | Value |
|---|---|
| Models | Claude Fable 5, Opus 4.8, Sonnet 5; OpenAI GPT‑5.6 Sol, Terra, Luna |
| Modes | Plain (no hint) and native /goal |
| Budget per run | 30 minutes of wall‑clock time |
| Outer‑agent timeout | 1 900 seconds |
| Reasoning | Maximum available for each model |
| Execution environment | Harbor 0.1.43, Docker, subscription authentication |
주요 비교는 플래그십 쌍(Fable 5 vs. Sol)에 초점을 맞추었으며, 각 모드당 세 번의 매치된 실행을 수행했습니다. 모든 여섯 모델도 30분 무힌트 설정으로 한 번씩 실행해 보다 넓은 시각을 제공했습니다.
Results Overview
All‑model baseline (single 30‑minute run)
각 모델에 대한 단일 매치 실행 결과 점수가 낮을수록 좋음을 보여줍니다. 차트(여기서는 재현되지 않음)는 Fable 5와 Sol이 분포 상위에 위치하고, 나머지 네 모델은 뒤처지는 모습을 나타냈습니다.
Flagship comparison (three runs each)
| Model | Run | Plain score | /goal score |
Δ (/goal − plain) |
|---|---|---|---|---|
| Fable 5 | 1 | 32 197 | 31 934 | ‑263 |
| 2 | 32 516 | 32 324 | ‑192 | |
| 3 | 32 446 | 35 178 | +2 732 | |
| GPT‑5.6 Sol | 1 | 33 581 | 39 371 | +5 790 |
| 2 | 35 539 | 32 703 | ‑2 836 | |
| 3 | 33 663 | 33 313 | ‑350 |
음수 Δ는 /goal이 더 나은 성능을 의미합니다.
Aggregate statistics
| Model | Plain mean | /goal mean |
Mean Δ | Median Δ |
|---|---|---|---|---|
| Fable 5 | 32 386 | 33 145 | +759 (worse) | ‑192 (better) |
| GPT‑5.6 Sol | 34 261 | 35 129 | +868 (worse) | ‑350 (better) |
Interpretation: /goal은 6번의 개별 실행 중 4번에서 승리했지만, 몇 차례의 큰 퇴보가 평균 점수를 악화시켰습니다.
Consistency comparison
- Fable 5의 일반 점수는 319점 범위 내에서 변동했으며, Sol의 일반 점수는 1 958점에 달했습니다.
- 전체 중 가장 좋은 클린 점수는 31 934(Fable 5,
/goal사용)였습니다.
How /goal Works Internally
두 가지 별도 구현이 존재합니다:
Claude Code (/goal as a stop‑hook)
- 각 모델 턴이 끝난 뒤 작은 평가자 모델(기본: Haiku)이 대화를 읽고 목표 달성 여부를 판단합니다.
- 평가자는 대화 내용만 볼 수 있으며 파일을 확인하거나 도구를 실행할 수 없습니다.
- “no” 응답이면 또 다른 턴이 진행되고, “yes”이면 목표가 해제됩니다.
- 문서: Anthropic의 goal docs.
OpenAI Codex (/goal as persisted state)
- CLI가 목표를 SQLite 데이터베이스에 저장하고 tool calls(
create_goal,get_goal,update_goal)를 제공합니다. - 스레드가 유휴 상태가 되면 Codex가 목표와 완료 감사를 포함한 연속 턴을 삽입합니다.
- 작업 모델은 파일과 도구를 검사할 수 있어 자체 작업을 평가할 수 있습니다.
- 소스 참고: thread goal actions, SQL schema, tool spec.
Why /goal Can Win Most Runs Yet Harm Average Performance
일반적인 코딩 작업에서는 진행이 점진적이고 눈에 보이기 때문에 추가 턴이 실패한 테스트를 고치는 경우가 많습니다. 하지만 어려운 최적화 문제에서는 한 번 선택된 솔버가 추가 시간 동안 기존 탐색 방향을 확대합니다. 초기 결정이 좋은 탐색 베이시스를 만들면 /goal이 도움이 되지만, 나쁜 베이시스를 만들면 추가 시간이 실수를 심화시킵니다. 따라서 중간 정도의 개선이 보이지만, 평균을 악화시키는 큰 퇴보가 가끔 발생하는 것이 관찰된 패턴을 설명합니다.
Limitations of the Study
- 공개되지 않은 NP‑hard 벤치마크 하나만 사용했으며, 결과가 다른 문제에 일반화되지 않을 수 있습니다.
- 깨끗한 매치 실행은 Fable 5와 Sol에만 세 번 제공되었고, 다른 모델은 각각 한 번씩만 실행되었습니다.
- 실험은 구독 서비스에서 순차적으로 진행돼 드리프트가 발생할 가능성이 있습니다.
- 컨테이너는 메타데이터가 하나라고 선언했음에도 여덟 개의 CPU를 노출했으며, 이는 Fable의 병렬 포트폴리오 접근에 유리하게 작용했을 수 있습니다.
- 모든 점수 출력은 래퍼가 조기 체크포인트와 최종 검증을 강제했기 때문에 유효했으며, 이는 벤치마크가 전체 시스템(모델, CLI, 프롬프트, 구독 서비스, 하네스)을 측정한다는 의미입니다.
Reproducing the Benchmark
전체 벤치마크 코드, 래퍼, 분석 스크립트, 그림 생성기, 증거 메모는 **CLIArena repository**에 공개되어 있습니다. 원시 작업 디렉터리는 크기 때문에 제외했지만, 메모에는 모든 점수, 도시별 세부 내역, 경과 시간, 전략, 제외 항목, 실행 ID가 기록되어 있습니다.
주요 명령어:
RUN_ID=article-kiro-YYYYMMDD-clean \
PHASE=nohint-all \
./scripts/run_subscription_article_matrix.sh
uv run python scripts/summarize_subscription_article_results.py $RUN_ID ...
uv run python scripts/analyze_subscription_article_results.py $RUN_ID ...
Community Insights
"The chart at the top is somewhat confusing. It says, “lower is better” but the y‑axis is inverted!" – tyleo
"Ultra mode could fan out parallel investigators and avoid local optima;
/goalworks better for single‑track investigations." – theptip
"Claude often forgets long‑term instructions;
/goalmay help retain the most important instruction in shorter sessions." – Tenoke
"Anthropic’s coding performance lags behind OpenAI; Codex feels faster and more flexible for large codebases." – sreekanth850
"
/goalhas replaced plan mode for many users; it forces the model to spend a fixed amount of time on a concrete objective, yielding more robust outputs." – o10449366
이 댓글들은 /goal에 대한 실제 사용 경험, 모델 패밀리 간 인식된 트레이드오프, 그리고 향후 평가 모드에 대한 제안을 강조합니다.
Takeaway
실험 결과 Claude Fable 5가 복잡한 NP‑hard 광섬유 네트워크 설계 작업에서 GPT‑5.6 Sol보다 현저히 강력하며, 더 낮은 점수와 더 일관된 결과를 제공합니다. 기본 /goal 플래그는 개별 실행을 개선할 수 있지만, 좋은 탐색 방향과 나쁜 탐색 방향을 모두 증폭시켜 평균 성능을 저하시킬 수 있습니다. 따라서 /goal은 전반적인 “더 열심히 시도” 옵션이 아니라 상황에 맞게 신중히 사용해야 합니다.