Anthropic Multi-Agent Research System Architecture
Anthropicは、Claudeのためにマルチエージェント・リサーチ・システムを実装しました。これにより、リード・オーケストレーター・エージェントと複数の専門化されたサブエージェントを調整することで、モデルが複雑でオープンエンドな調査を実行できるようになります。このアーキテクチャにより、Claudeは推論能力とトークン使用量をスケールさせることができ、マルチエージェント構成(Claude Opus 4をリードとし、Claude Sonnet 4をサブエージェントとして使用)を使用した場合、単一エージェントのClaude Opus 4システムと比較して、内部リサーチ評価において90.2%のパフォーマンス向上を実現しました。
Orchestrator-Worker Architecture
リサーチ・システムは、従来のRetrieval Augmented Generation (RAG) の静的な検索を超えて、オーケストレーター・ワーカー・パターンを利用しています。静的なデータのチャンクを取得する代わりに、システムは動的で多段階の検索プロセスを採用しています。
The Research Workflow
- Lead Researcher (Orchestrator): ユーザーのクエリを分析し、戦略的な計画を策定し、この計画をMemoryに保存することで、コンテキスト・ウィンドウ(200,000トークンを超える)が切り詰められた場合でも永続性を確保します。
- Subagents (Workers): リード・エージェントは、クエリの異なる側面を並列に探索するために、複数の専門化されたサブエージェントを生成します。これらのサブエージェントは、検索ツールを使用し、結果を評価するためにインターリーブされた思考(interleaved thinking)を適用し、結果をリード・エージェントに返します。
- Synthesis: リード・エージェントはサブエージェントの調査結果を統合し、さらなる調査が必要かどうかを判断します。
- Citation Agent: リサーチ・ループが完了すると、専用のCitationAgentがレポートを処理し、すべての主張がソースに適切に帰属されていることを確認します。
Technical Drivers of Performance
AnthropicのBrowseComp評価の分析により、トークン使用量がパフォーマンスの主な要因であることが明らかになりました。これは結果の分散の80%を説明しています。マルチエージェント・システムは、個別のコンテキスト・ウィンドウに作業を分散させることでトークン使用量を効果的にスケールさせ、並列推論に必要な能力を提供します。
Parallelization Gains
レイテンシを低減するために、システムは2つのレベルの並列化を採用しています:
- Agent Parallelism: リード・エージェントは、逐次的にではなく、3-5個のサブエージェントを同時に起動します。
- Tool Parallelism: サブエージェントは、3つ以上のツール・コールを並列に実行します。
これらの最適化により、複雑なクエリに対してリサーチ・タイムを最大90%削減しました。
Prompt Engineering Principles for Agents
マルチエージェント・システムは調整の複雑さを導入するため、Anthropicはエージェントの挙動を安定させるために特定のプロンプト・ヒューリスティクスを利用しました:
- Delegation Guidance: リード・エージェントは、重複作業を防ぐために、サブエージェントに対して明確な目的、出力形式、ツール・ガイダンス、および厳格なタスク・バウンダリを提供することが求められます。
- Effort Scaling: プロンプトには、クエリの複雑さに合わせてリソース配分を一致させるための明示的なルールが含まれています(例:単純な事実については1つのエージェントと3-10個のツール・コールが必要ですが、複雑なリサーチには10個以上のサブエージェントが必要になる場合があります)。
- Search Strategy: エージェントは、最初に広範なクエリを使用し、詳細に掘り下げる前に「広く始めて、それから絞り込む」ように指示されます。
- Self-Improvement: Claude 4モデルは、プロンプト・エンジニアとして使用され、失敗モードを診断し、ツールの記述を書き換えることで、タスク完了時間を40%減少させました。
- Thinking Processes: システムは、リード・エージェントの計画のために「Extended Thinking」を利用し、サブエージェントがツール結果を評価し、ギャップを識別するために「Interleaved Thinking」を利用します。
Evaluation and Reliability Challenges
マルチエージェント・システムを評価することは困難です。なぜなら、エージェントが同じ目標に到達するために異なる有効なパスを辿る可能性があるからです。Anthropicは、3段階の評価戦略を採用しています:
- Small-Sample Testing: プロンプトの微調整による劇的な影響を定数数(定数数)のリアルワールド・クエリ(~20個)を使用して、迅速に反復します。
- LLM-as-Judge: 単一のLLMコールによって、事実の正確性、引用の正確性、完全性、完全性、ソースの品質、およびツールの効率性をカバーする評価基準(rubric)評価します。
- Human Evaluation: エージェントが権威のある学術的なPDFよりもSEO最適化されたコンテンツを好む傾向などのエッジ・ケースを特定するための、手動テストを行いました。
Production Engineering
プロトタイプから本番環境への移行に向けて、Anthropicはいくつかの信頼性対策を実装しました:
- State Recovery: エージェントはステートフルであり、エラーが累積するため、システムは再起動ではなく、失敗した時点から再続行可能です。
- Rainbow Deployments: アップデート中に長時間実行されるエージェント・プロセスを中断させないために、トラフィックを徐々に旧バージョンから新バージョンへシフトさせます。
- Observability: 完全な本番環境のトレーシングを利用して、意思決定パターンや相互作用の構造を監視し、なぜエージェントが情報を探すのに失敗したのかを診断します。
Limitations and Use Cases
マルチエージェント・システムは、普遍的に適用可能ではありません。エージェント間の相互依存性が高いタスクや、ほとんどのコーディング・タスクのように、共有コンテキストが必要なタスクには不向きです。これらは、大量の並列化と、単一のコンテキスト・ウィンドウを超える情報を含む、高価値なタスクに最も効果的です。
経済的に、これらのシステムはリソース集約的です。マルチエージェント・システムは、標準的なチャット・インタラクションと比較して約15倍、単一エージェント・インタラクションと比較して約4倍のトークンを使用します。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch