에이전트 시스템에서의 모델 라우팅: 분류에서 최적화로의 이동
에이전트 시스템에서의 모델 라우팅: 분류에서 최적화로의 이동
에이전트 시스템에서의 모델 라우팅은 단순한 분류 작업이 아니라 시스템 최적화 문제입니다. 효과적인 라우팅은 모델 가격, 캐시 동작, 인프라 상태, 규정 준수 제약 간의 상호작용을 균형 있게 맞추어 전체 시스템에 대한 최적 운영 지점을 찾는 것을 요구합니다.
모델 비용의 숨은 복잡성
실제 운영 비용은 모델, 워크로드, 서빙 인프라 간의 상호작용에 의해 결정되며, 이로 인해 스티커 가격은 라우팅 결정을 위한 신뢰할 수 없는 지표가 됩니다.
AppWorld Test Challenge의 417개 작업에서 CodeAct 에이전트를 사용한 테스트에서, Claude Sonnet 4.6은 총 $79($0.19/작업)이 들었고, GPT-4.1은 $155($0.37/작업)이 들었습니다. 이는 GPT-4.1이 토큰 가격이 더 낮고 Sonnet이 약 세 배 많은 추론 단계가 필요함에도 불구하고 발생했습니다. 이 차이는 캐싱으로 인해 발생했습니다: Sonnet의 낮은 캐시-읽기 가격은 단계 간에 큰 컨텍스트 청크를 재사용하는 에이전트 워크로드에 대해 효과적인 입력 비용을 크게 줄였습니다.
왜 작업 난이도는 불완전한 신호인가
예상된 작업 난이도에만 기반한 라우팅은 난이도가 요청 시작 시 종종 보이지 않으며 다른 생산 제약과 균형을 맞춰야 하기 때문에 실패합니다.
- 보이지 않는 난이도: "이 계약을 요약해줘"와 같이 aparentemente 간단한 요청이라도 검색, 규정 준수 검사, 여러 번의 개선 라운드를 포함하는 복잡한 내부 프로세스를 촉발할 수 있으며, 이는 실제 난이도가 실행 중에만 드러남을 의미합니다.
- 시스템적 제약: 기업 환경에서는 라우터가 데이터 거주 규칙, 개인정보 보호 제약, 규정 준수 요구사항, 승인된 모델 목록과 함께 품질과 비용을 저글링해야 합니다.
모델 속도를 넘어선 지연
엔드 투 엔드 지연은 모델 자체의 원시 속도보다 인프라 및 라우팅 오버헤드에 더 많이 영향을 받습니다.
응답 시간을 지배하는 요인에는 하드웨어 사양, 캐시 따뜻함, 엔드포인트 혼잡이 포함됩니다. 또한, 라우팅의 세분성은 트레이드오프를 도입합니다: 작업당 한 번 라우팅하면 오버헤드가 최소화되지만, 실행의 모든 단계에서 라우팅하면 운영 복잡성과 지연이 증가하는 비용으로 유연성이 높아집니다.
최적화 기반 라우팅 접근 방식으로의 전환
라우팅을 다목적 최적화 문제로 취급하면 단일 고정 결정이 아닌 유연한 비용-정확도 프론티어를 허용합니다.
IBM Research는 "이 작업에 가장 적합한 모델은 무엇인가?"라는 질문을 던지는 것에서 비용, 품질, 지연을 동시에 최적화하는 알고리즘으로 전환했습니다. AppWorld Test Challenge에서 CodeAct 에이전트를 사용한 테스트는 이 접근 방식이 다양한 운영 지점을 제공함을 보여주었습니다:
- 지연 최적화 구성: Opus 단독 사용과 비교하여 $93과 83초에 84% 정확도를 달성했으며, 이는 비용 21% 감소 및 지연 9% 감소를 나타내며 정확도는 단지 4%만 감소했습니다.
- 효율성: 최적화 프로세스는 가볍고, 작업당 약 6ms와 2kB의 메모리를 요구하여 라우터가 시스템 병목이 되지 않도록 보장합니다.
표준 난이도 기반 라우터와 비교했을 때, 유사한 정확도 범위에 도달하지만 더 높은 비용을 초래할 수 있는 반면, 최적화 기반 접근 방식은 트레이드오프 공간을 더 효과적으로 탐색합니다.
결론: 시스템 최적화로서의 라우팅
모델 라우팅은 특정 작업에 대한 '최고' 모델을 선택하는 것이 주로 아니라 전체 시스템에 대한 최적 운영 지점을 찾는 것입니다. 모델은 캐시 동작, 인프라 상태, 워크로드 패턴 중 하나의 변수에 불과합니다.