AI 에이전트 토큰 경제학 최적화: 커스텀 딥 리서치 파이프라인 구축하기
AI 에이전트 토큰 경제학 최적화: 커스텀 딥 리서치 파이프라인 구축하기
에이전트 기반 리서치의 높은 비용
복잡한 AI 리서치 파이프라인을 실행하면 토큰이 빠르게 소진될 수 있습니다. 표준 /deep-research 실행은 100개 이상의 에이전트를 실행하고 100개 이상의 검증을 위한 클레임을 큐에 쌓을 수 있으며, 최종적인 종합 결과물을 내놓기도 전에 (Claude Max 5x와 같은) 상위 티어 구독 제한을 30분 만에 모두 소진할 수도 있습니다.
이를 해결하기 위해, 토큰 소비를 최적화하고 출력의 신뢰성을 높이기 위해 커스텀 딥 리서치 파이프라인이 개발되었습니다. 단일 프론티어 모델을 사용하는 대신 멀티 모델 오케스트레이션 전략을 채택함으로써, 월간 지출을 늘리지 않고도 리서치 지속 시간을 약 10배 연장할 수 있었습니다.
모델 오케스트레이션 및 역할 할당
효율성은 모든 작업에 가장 비싼 모델을 사용하는 대신, 각 모델의 강점과 비용에 따라 특정 역할을 특정 모델에 고정함으로써 달성됩니다. 이는 하위 에이전트가 부모 에이전트의 비싼 모델을 기본값으로 상속받는 "상속" 문제를 방지합니다. \n### 오케스트레이션 스택
| 역할 | 모델 | 근거 |
|---|---|---|
| Find | Claude Sonnet 5 | 강력한 에이전트 성능; 대량 검색에 비용 효율적임. |
| Verify | Claude Opus 4.8 | 높은 정확도; 클레임 및 인용구를 확인하는 데 필수적임. |
| Judge & Plan | Claude Fable 5 | 가장 비싼 모델; 고수준의 분해 및 분쟁 해결을 위해 예약됨. |
| Small Tasks | Claude Haiku 4.5 | 추출 및 포맷팅을 위한 빠르고 저렴한 모델. |
| Run Tools | Codex (GPT-5.5) | 설치 및 검사를 위한 터미널 벤치마크에서 높은 성능을 보임. |
| Second Opinion | Antigravity (Gemini 3.1 Pro) | 공유된 사각지대를 피하기 위해 다른 모델 패밀리 사용. |
교차 벤더 통합
여러 기존 구독(Claude, Codex, Antigravity)을 활용하기 위해, Bash wrapper를 사용하면 Claude 에이전트가 다른 벤더의 CLI를 헤드리스 하위 에이전트로 호출할 수 있습니다. 이 접근 방식은 토큰 사용량을 여러 계정에 분산시키고 자동 폴백(fallback) 메커니즘을 제공합니다. 즉, 한 벤더의 사용 제한에 도달하면 오케스트레이터가 작업을 Claude 모델로 리다이렉트합니다.
신뢰성 확보 및 환각 현상 감소
비용 최적화만으로는 정확성을 보장할 수 없습니다. 환각 현상을 방지하기 위해 파이프라인은 엄격한 규칙을 구현합니다:
- 관심사의 분리: 클레임을 찾는 에이전트가 검증하는 에이전트와 동일해서는 안 됩니다.
- 소스 요구 사항: URL과 기본 소스에서의 직접 인용구가 없는 발견 사항은 지식 베이스에 포함될 수 없습니다.
- 문자 그대로의 정확성: 모델은 소스 페이지에 명시적으로 나타나지 않는 숫자를 언급하는 것이 금지됩니다.
이 규칙들은 반복적으로 개선됩니다. 검증 단계에서 새로운 유형의 오류가 발견될 때마다 해당 규칙을 규칙 시스템 프롬프트에 추가됩니다. 그러나 인간의 감독은 필수적입니다. 자동화된 규칙은 너무 경직될 수 있습니다. 예를 들어, "unvalidated claims"를 거부하는 규칙 때문에 프로젝트의 자체 마케팅 클레임이 품질 관리가 되지 않았다는 이유로 주요 산업 프로젝트를 누락시킨 사례가 있었습니다. 해결책은 규칙을 정교화하여 프로젝트 전체가 아닌 특정 클레임만 거부하도록 만드는 것이었습니다.
전략적 파이프라인 시퀀싱
작업 순서가 토큰 효율성에 큰 영향을 미줍니다. 광범위한 /deep-research 명령으로 시작하는 대신, 파이프라인은 다음 순서를 따릅니다:
- Find & Verify: 저렴한 모델이 데이터를 찾고, 정확한 모델이 이를 검증합니다.
- Judge & Run: 고수준 모델이 계획을 수하고 도구 기반의 증거 수집을 실행합니다.
- Deep-Validate: 다수결 투표 및 인간의 승인 프로세스.
- Final Synthesis:
/deep-research는 인터넷을 무작정 탐색하는 대신, 기존 발견 사항을 심화화하고 공백을 채우기 위한 최종 단계로 사용됩니다. 이는 필요한 에이전트 수를 줄이고 도구가 고정된 클레임 리스트를 바탕으로 작동하도록 보장합니다.
토큰 경제학에 관한 주요 발견
이 파이프라인을 통해 수행된 연구는 AI 에이전트가 토큰을 소비하는 방식에 대해 몇 가지 중요한 통찰찰을 제공합니다:
- Harness Impact: 모델을 실행하는 프레임워크(harness)에 따라 동일한 모델이라도 토큰 사용량이 66배까지 차이 날 수 있으며, 가벼운 설정이 종종 더 높은 점수를 기록합니다.
- Context Compaction Risks: 자동화된 컨텍스트 압축은 모델이 히스토리를 요약약하고, 필요한 파일을 제거한 뒤, 다시 읽어들이는 "압축 루프"를 발생시켜 잠재적으로 비용을 2배로 늘릴 수 있습니다.
- Cache Invalidation: 세션 내에서 단일 도구 스키마를 추가하거나 순서를 변경하는 것만으로도 전체 캐시된 프리픽스(prefix)가 무효화되어 세션이 전체 가격으로 다시 청구될 수 있습니다.
- Estimation Gaps: 단순한 토큰 카운터는 실제 인보이스를 과소평가하는 경우가 많습니다. 어떤 경우에는 계산된 비용이 월 $3.60/month였음에도 불구하고, 재시도 증폭(retry amplification)과 프레임워크 오버헤드로 인해 실제 인보이스는 $25-40/month가 나왔습니다.
커뮤니티 관점 및 반론
파이프라인 방식이 비용 관리를 위한 구조화된 방식을 제공하지만, 커뮤니티 논의에서는 대안적인 전략과 잠재적인 위험 요소를 강조합니다:
"에이전트 기반 리서치에서 대부분의 사람들이 할당된 한도를 한정 없이 소진하는 이유는 대부분 하위 에이전트 때문입니다. 하위 에이전트를 사용하지 않으면 Pro 티어만으로도 일일 8-12시간 코딩 세션에 충분히 사용할 수 있다는 것을 알 수 있을게 될 것입니다."
다른 기여자는 벤더 종속성을 피하고 비용을 줄이기 위해 로컬 LLM을 사용하는 데 집중할 것을 제안합니다:
"저는 처음부터 토큰을 구매하지 않았습니다. 대신 GPU를 샀습니다... Big/Cloud LLM을 사용하여 로컬/소형 LLM을 위한 '충분히 괜찮은 설정'을 위한 도움을을 받으세요."
또한, 일부는 환각 현상이 규칙이나 다른 모델을 사용하여 완전히 해결될 수 없다고 주장하며, LLM의 본질적인 특성상 "환각 없는 리서치"는 불가능한 목표라고 제안합니다.