Anthropic Multi-Agent Research System Architecture

Anthropic는 Claude를 위한 멀티 에이전트 연구 시스템을 구현하여, 리드 오케스트레이터 에이전트와 여러 전문화된 서브 에이전트를 조정함으로써 모델이 복잡하고 개방적인 연구를 수행할 수 있도록 했습니다. 이 아키텍처를 통해 Claude는 추론 능력과 토큰 사용량을 확장할 수 있으며, 그 결과 멀티 에이전트 설정(Claude Opus 4 리드와 Claude Sonnet 4 서브 에이전트 사용)을 사용할 때 단일 에이전트 Claude Opus 4 시스템에 비해 내부 연구 평가에서 90.2%의 성능 향상을 이루었습니다.

Orchestrator-Worker Architecture

연구 시스템은 전통적인 검색 증강 생성(Retrieval Augmented Generation, RAG)의 정적인 데이터 검색을 넘어선 오케스트레이터-워커 패턴을 활용합니다. 정적인 데이터 청크를 가져오는 대신, 시스템은 동적이고 다단계적인 검색 프로세스를 채택합니다.

The Research Workflow

  1. Lead Researcher (Orchestrator): 사용자 쿼리를 분석하고, 전략적 계획을 수립하고, 컨텍스트 윈도우(200,000 토큰 초과)가 잘릴 경우를 대비해 지속성을 보장하기 위해 이 계획을 Memory에 저장합니다.
  2. Subagents (Workers): 리드 에이전트는 쿼리의 다양한 측면을 병렬로 탐색하기 위해 여러 전문화된 서브 에이전트를 생성합니다. 이 서브 에이전트들은 검색 도구를 사용하고, 결과를 평가하기 위해 interleaved thinking을 적용하며, 발견한 내용을 리드 에이전트에게 반환합니다.
  3. Synthesis: 리드 에이전트는 서브 에이전트의 발견 내용을 종합하여 추가 연구가 필요한지 결정합니다. 필요한 경우, 전략을 개선하거나 추가 서브 에이전트를 생성합니다.
  4. Citation Agent: 연구 루프가 완료되면, 전용 CitationAgent가 보고서를 처리하여 모든 주장이 적절하게 출처처에 귀속속됩니다.

Technical Drivers of Performance

Anthropic의 BrowseComp 평가 분석 결과, 토큰 사용량이 성능의 주요 동인이며 결과의 변동성 중 80%를 설명합니다. 멀티 에이전트 시스템은 작업을 별도의 컨텍스트 윈도우에 분산하여 토큰 사용량을 효과적으로 확장하며, 병렬 추론에 필요한 충분한 용량을 제공합니다.

Parallelization Gains

지연 시간을 줄이기 위해 시스템은 두 단계의 병렬화를 채택합니다:

  • Agent Parallelism: 리드 에이전트는 서브 에이전트를 순차적으로가 아닌 동시에 3-5개 생성합니다.
  • Tool Parallelism: 서브 에이전트들은 세 개 이상의 도구 호출을 병렬로 실행합니다.

이러한 최적화는 복잡한 쿼리에 대해 연구 시간을 최대 90%까지 단축시켰습니다.

Prompt Engineering Principles for Agents

멀티 에이전트 시스템은 조정의 복잡성을 유도하기 때문에, Anthropic은 에이전트 동작을 안정화하기 위해 특정 프롬프트 휴리스틱을 활용했습니다:

  • Delegation Guidance: 리드 에이전트는 중복된 노력을 방지하기 위해 서브 에이전트에게 명확한 목표, 출력 형식, 도구 가이드라인, 엄격한 작업 경계를 제공하도록 프롬프트됩니다.
  • Effort Scaling: 프롬프트에는 쿼리 복잡도에 따라 리소스 할당을 맞추는 명시적인 규칙이 포함됩니다(예: 단순한 사실은 1개의 에이전트와 {3-10} tool calls가 필요하며, 복잡한 연구는 10개 이상의 서브 에이전트가 필요할 수 있습니다).
  • Search Strategy: 에이전트들은 처음에 광범위한 쿼리를 사용하여 세부 사항을 파고들기 전에

Sources

관련