sierra-research/tau2-bench

τ-Bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains

What it solves

$ au$-Bench は、AI カスタマーサービスエージェントが現実世界のインタラクションをどの程度適切に処理できるかを評価するための標準化された方法を提供します。厳格なポリシーに従い、外部ツールを使用し、異なるモダリティ(テキストおよび音声)を介して複雑でマルチターンな会話を通じてユーザーとやり取りするエージェントのテストの難しさを解決します。

How it works

このフレームワークは、エージェントとユーザーシミュレーター間のインタラクションをシミュレートします。特定の ""domain""(航空、小売、通信、銀行など)を定義しており、各 domain はエージェントが従うべき一連の運用ポリシー、呼び出せるツール、および完了すべき一連のタスクを包含しています。

主に 2 つの通信モードをサポートしています:

  • Text (half-duplex): 従来のターンベースのチャット。
  • Voice (full-duplex): OpenAI、Gemini、xAI などのプロバイダーを使用したリアルタイムかつ同時的な音声インタラクション。

さらに、RAG (Retrieval-Augmented Generation) 能力をテストするための専門的な知識ドメインも含まれており、エージェントが非構造化ドキュメントを検索して顧客の問題を解決できるようにします。

Who it's for

  • Agent Developers: カスタマーサービス用 AI エージェントを構築しており、ポリシーへの準拠性やツール使用の正確性を検証する必要がある開発者。
  • AI Researchers: ツールが多用されるマルチターン環境における LLM-based エージェントの信頼性を研究する研究者。
  • RL Practitioners: 提供された Gymnasium-compatible インターフェースを使用して、強化学習を通じてエージェントを訓練する開発者。

Highlights

  • Multimodal Evaluation: テキストベースおよびエンドツーエンドのオーディオネイティブな音声インタラクションをサポート。
  • Diverse Real-World Domains: 航空、小売、通信、銀行業界向けのプリビルドされたシナリオ。
  • Knowledge-Aware Testing: 知識検索を評価するための専用の RAG パイプラインとドキュメント検索。
  • Rigorous Grading: 評価の正確性を確保し、曖昧な制約を排除するために、75 件以上の修正が行われた洗練されたタスクセットを含んでいます。