AIエージェントのトークノミクスを最適化する:カスタム・ディープ・リサーチ・パイプラインの構築
AIエージェントのトークノミクスを最適化する:カスタム・ディープ・リサーチ・パイプラインの構築
エージェントによるリサーチの高コスト性
複雑なAIリサーチ・パイプラインを実行すると、トークンの急速な枯渇を招く可能性があります。標準的な /deep-research 実行では、100以上のエージェントを起動し、100以上の検証対象となる主張(claims)をキューに入れ、最終的な統合(synthesis)を行う前に、わずか30分足らずで Claude Max 5x のような上位サブスクリプションの制限を使い果たしてしまう可能性があります。
これを解決するために、トークン消費を最適化し、出力の信頼性を高めるためのカスタム・ディープ・リサーチ・パイプラインが開発されました。単一の最先端モデル(frontier model)からマルチモデル・オーケストレーション戦略へと移行することで、月間の支出を増やすことなく、リサーチ期間を約10倍に延長することができました。
モデル・オーケストレーションと役割の割り当て
効率性は、すべてのタスクに最も高価なモデルを使用するのではなく、各モデルの強みとコストに基づいて特定の役割に特定のモデルを固定することで達成されます。これにより、サブエージェントが親エージェントの高価なモデルをデフォルトで使用してしまう「継承」問題を防止できます。
オーケストレーション・スタック
| 役割 | モデル | 根拠 |
|---|---|---|
| Find | Claude Sonnet 5 | 強力なエージェント性能。大量の検索においてコスト効率が高い。 |
| Verify | Claude Opus 4.8 | 高い精度。主張や引用のチェックに不可欠。 |
| Judge & Plan | Claude Fable 5 | 最も高価。高度な分解と紛争解決のために予約されている。 |
| Small Tasks | Claude Haiku 4.5 | 抽出やフォーマットにおいて高速かつ安価。 |
| Run Tools | Codex (GPT-5.5) | インストールや調査におけるターミナル・ベンチマークでの高い性能。 |
| Second Opinion | Antigravity (Gemini 3.1 Pro) | 共通の盲点を避けるための異なるモデル・ファミリー。 |
クロスベンダー統合
既存の複数のサブスクリプション(Claude, Codex, および Antigravity)を活用するために、Bash ラッパーを使用することで、Claude エージェントが他のベンダーの CLI をヘッドレス・サブエージェントとして呼び出すことを可能にします。このアプローチは、トークン使用量を異なるアカウントに分散させ、自動フォールバック・メカニズムを提供します。つまり、あるベンダーが使用制限に達した場合、オーケストレーターがタスクを Claude モデルにリダイレクトします。
信頼性の確保とハルシネーションの低減
コストの最適化だけでは、精度を保証することはできません。ハルシネーションを防ぐために、パイプラインは厳格な検証ルールを実装しています。
- 関心の分離: 主張(claim)を見つけるエージェントは、決してそれを検証するエージェントではありません。
- ソースの要件: URL と一次ソースからの直接引用がない限り、いかなる発見もナレッジベースには入りません。
- リテラルな正確性: モデルは、ソースページに明示的に記載されていない数値を述べることは禁止されています。
これらのルールは反復的です。検証ステップで新しい種類の誤りが検出されるたびに、ルールがシステム・プロンプトに追加されます。しかし、人間の監督は依然として必須です。自動化されたルールは厳格すぎる場合があります。例えば、「未検証の主張」を拒否するルールが、あるプロジェクトのマーケティング主張が品質管理されていなかったために、主要な業界プロジェクトをパイプラインから除外させてしまったことがあります。修正策は、特定の主張を拒否するようにルールを洗練させることであり、プロジェクト全体を拒否することではありませんでした。
戦略的なパイプライン・シーケンス
操作の順序は、トークン効率に大きな影響を与えます。広範な /deep-research コマンドから始めるのではなく、パイプラインは以下のシーケンスに従います。
- Find & Verify: 安価なモデルがデータを検索し、正確なモデルがそれを検証します。
- Judge & Run: 高レベルなモデルが計画を立て、ツールベースの証拠収集を実行します。
- Deep-Validate: 多数決と人間の承認プロセス。
- Final Synthesis:
/deep-researchは、インターネットを盲目的に探索するのではなく、既存の発見を深め、ギャップを埋めるための 最終 ステップとして使用されます。これにより、必要なエージェントの数が増え、ツールが固定された主張のリストに基づいて動作することを保証します。
トークン・エコノミクスの主要な知見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見見[... (truncated)
トークン・エコノミクスの主要な知見
このパイプラインを通じて行われた調査により、AIエージェントがどのようにトークンを消費するかについて、いくつかの重要な洞察が得られました。
- Harness の影響: モデルを実行するために使用されるフレームワーク(harness)によって、同じモデルであってもトークン使用量に66倍もの差が生じることがあります。構成が簡素なものほど、使用量が高くなる傾向があります。
- コンテキスト圧縮のリスク: 自動的なコンテキスト圧縮は、「圧縮ループ」を引き起こす可能性があります。これは、モデルが履歴を要約し、必要なファイルを排除し、その後それらを再読み込みするというプロセスを繰り返すことで、請求額を倍増させる可能性があります。
- キャッシュの無効化: セッション内で単一のツール・スキーマを追加または並べ替えるだけで、キャッシュされたプレフィックス全体が無効になり、セッションが全額で再請求される原因となります。
- 見積もりとの乖離: 単純なトークンカウンターは、実際の請求額を過小評価することがよくあります。リトライの増幅やフレームワークのオーバーヘッドにより、計算上のコストが月額3.60ドルであったものが、実際の請求額が月額25〜40ドルになるケースもあります。
コミュニティの視点と反論
パイプライン方式はコスト管理のための構造化された方法を提供しますが、コミュニティの議論では、代替戦略や潜在的な落とし穴が指摘されています。
「ほとんどの人が割り当てられた制限を使い果たしてしまう理由は、主にサブエージェントのせいです。サブエージェントの使用をやめれば、Pro ティアでも毎日の8〜12時間のコーディング・セッションには十分です。」
他の貢献者は、ベンダーロックインを避け、コストを削減するためにローカル LLM に焦点を当てることを提案しています。
「私はそもそもトークンを購入していません。代わりに GPU を購入しました... 大規模なクラウド LLM を使用して、ローカル/小型 LLM のための『十分な設定』を見つけるための助けとして利用してください。」
さらに、ハルシネーションはルールや他のモデルによって完全に解決することはできず、LLM の固有の性質上、「ハルシネーションなし」という目標は不可能であると主張する人もいます。