Weave Router 2.0: 코딩 에이전트를 위한 오픈 소스 모델 라우팅

Weave Router 2.0은 주요 코딩 벤치마크에서 GPT-6 Astra와 같은 최첨단 모델과 대등한 성능을 달성하는 동시에 운영 비용과 지연 시간을 크게 줄였습니다. 작업 복잡도에 따라 LLM을 지능적으로 전환함으로써(복잡한 시스템 설계에는 고성능 모델을, 간단한 업데이트에는 경량 모델을 사용) 라우터는 정확성과 효율성 사이의 균형을 최적화합니다.

성능 벤치마크

Weave Router 2.0은 Terminal Bench 4.0 및 SWE Atlas를 사용하여 GPT-6 Astra와 비교 테스트되었습니다. 결과에 따르면 앙상블 접근 방식은 단일 최첨단 모델의 통과율과 일치하면서도 상당한 효율성 향상을 제공합니다:

벤치마크 통과율 Astra 대비 비용 Astra 대비 속도
Terminal Bench 4.0 동일 52% 2.2배 빠름
SWE Atlas 동일 54% 2.5배 빠름

기술 아키텍처

코딩 에이전트 세션에서의 라우팅 결정은 복잡합니다. 100번의 턴과 10개의 사용 가능한 모델이 있는 일반적인 세션은 잠재적인 경로의 방대한 탐색 공간을 생성하기 때문입니다. 이를 관리하기 위해 Weave Router 2.0은 세 가지 주요 기술적 개선 사항을 적용했습니다:

은닉 마르코프 모델(HMM) 및 분류기

강화 학습(RL)을 통해 라우팅 공간을 완전히 탐색하는 데 드는 막대한 비용을 피하기 위해, 시스템은 은닉 마르코프 모델(HMM)을 사용하여 세션 상태를 추적합니다. 이 HMM을 통해 라우터는 현재 세션 상태뿐만 아니라 세션이 해당 상태에 도달하기까지의 과거 궤적까지 이해할 수 있습니다. 그런 다음 분류기가 이 세션 상태를 유사한 모델의 특정 "버킷"에 매핑하여, 주어진 컨텍스트에서 효과적일 가능성이 낮은 모델을 제거함으로써 탐색 공간을 효과적으로 가지치기합니다.

합성 데이터 부트스트래핑

라우터는 최첨단 LLM을 활용하여 더 크고 다양한 코딩 에이전트 세션 세트에 라벨을 지정합니다. 이 합성 데이터는 HMM과 분류기를 모두 부트스트래핑하는 데 사용되며, 라우팅 로직의 RL 구성 요소에 더 풍부한 보상 신호를 제공합니다.

캐시 제거 영향 계산

비용을 최소화하기 위해 라우터에는 모델 전환의 기대 가치를 계산하는 하위 시스템이 포함되어 있습니다. 모델을 전환하면 새 모델의 프롬프트 캐시를 다시 채우기 위해 종종 높은 일회성 비용이 발생하므로, 라우터는 더 유능한 모델을 사용할 때의 예측 이점이 캐시 제거 비용보다 클 때만 전환을 트리거합니다.

커뮤니티 인사이트 및 고려 사항

발표 이후 개발자 커뮤니티에서는 모델 라우터의 구현 및 평가와 관련하여 몇 가지 기술적 고려 사항을 제기했습니다:

  • 성능 상한선: 일부 사용자는 최첨단 모델이 라벨링한 데이터로 훈련된 라우터가 해당 모델의 성능을 능가할 수 있는지 의문을 제기하며, 주요 이득은 순수 성능 향상이 아닌 비용 절감일 것이라고 지적했습니다.
  • 기존 도구와의 비교: 사용자들은 특히 아키텍처 계획 및 코드 리뷰를 위해 Claude Code의 "advisor mode"(Sonnet 5.5 및 Fable advisor)나 Copilot의 "HydraFusion" 시스템과 같은 다른 다중 모델 시스템과 라우터를 벤치마킹할 것을 제안했습니다.
  • 상태 추적: 탐색 공간의 수학적 표현에 대한 논의가 있었으며, 일부는 라우팅 결정이 100번의 턴에 대한 사전 결정된 경로가 아니라 일반적으로 순차적(턴 단위)으로 이루어진다는 점을 언급했습니다.
  • 캐시 효율성: 모델을 자주 전환할 때 캐시되지 않은 입력 토큰이 증가할 가능성에 대한 우려가 제기되었으며, 이는 전체 비용 절감 효과에 영향을 미칠 수 있습니다.

Weave Router는 GitHub에서 오픈 소스 프로젝트로 제공되며 호스팅 서비스로도 이용할 수 있습니다.

Sources

관련