sierra-research/tau2-bench

τ-Bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains

What it solves

$ au$-Bench 提供了一個標準化的方式來評估 AI 客服代理人處理真實互動的表現。它解決了測試代理人必須遵循嚴格政策、使用外部工具,並在不同模態(文字與語音)進行複雜、多輪對話中與使用者互動的困難度。

How it works

該框架模擬了代理人與使用者模擬器之間的互動。它定義了特定的 ""domain""(例如:航空公司、零售、電信與銀行)"",其中每個 domain 包含代理人必須遵循的一組操作政策、可調用的工具,以及一系列需要完成的任務。

它支援兩種主要的通訊模式:

  • Text (half-duplex): 傳統的輪次制聊天。
  • Voice (full-duplex): 使用 OpenAI、Gemini 與 xAI 等提供者進行即時、同步的音訊互動。

此外,它還包含一個專門的知識領域用於測試 RAG (Retrieval-Augmented Generation) 能力,允許代理人搜尋非結構化文件以解決客戶問題。

Who it's for

  • Agent Developers: 需要驗證其代理人遵循政策與工具使用準確性的客服 AI 開發者。
  • AI Researchers: 研究 LLM-based 代理人在工具密集型、多輪環境中可靠性的研究人員。
  • RL Practitioners: 使用提供的 Gymnasium-compatible 介面透過強化學習訓練代理人的開發者。

Highlights

  • Multimodal Evaluation: 支援文字基礎與端到端音訊原生語音互動。
  • Diverse Real-World Domains: 為航空公司、零售、電信與銀行產業預建了場景。
  • Knowledge-Aware Testing: 專門的 RAG 流程與文件搜尋,用於評估知識檢索能力。
  • Rigorous Grading: 包含一組精煉的任務,包含超過 75 項修正,以確保評估準確性並消除模糊的限制條件。