sierra-research/tau2-bench
τ-Bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains
What it solves
$ au$-Bench 提供了一個標準化的方式來評估 AI 客服代理人處理真實互動的表現。它解決了測試代理人必須遵循嚴格政策、使用外部工具,並在不同模態(文字與語音)進行複雜、多輪對話中與使用者互動的困難度。
How it works
該框架模擬了代理人與使用者模擬器之間的互動。它定義了特定的 ""domain""(例如:航空公司、零售、電信與銀行)"",其中每個 domain 包含代理人必須遵循的一組操作政策、可調用的工具,以及一系列需要完成的任務。
它支援兩種主要的通訊模式:
- Text (half-duplex): 傳統的輪次制聊天。
- Voice (full-duplex): 使用 OpenAI、Gemini 與 xAI 等提供者進行即時、同步的音訊互動。
此外,它還包含一個專門的知識領域用於測試 RAG (Retrieval-Augmented Generation) 能力,允許代理人搜尋非結構化文件以解決客戶問題。
Who it's for
- Agent Developers: 需要驗證其代理人遵循政策與工具使用準確性的客服 AI 開發者。
- AI Researchers: 研究 LLM-based 代理人在工具密集型、多輪環境中可靠性的研究人員。
- RL Practitioners: 使用提供的 Gymnasium-compatible 介面透過強化學習訓練代理人的開發者。
Highlights
- Multimodal Evaluation: 支援文字基礎與端到端音訊原生語音互動。
- Diverse Real-World Domains: 為航空公司、零售、電信與銀行產業預建了場景。
- Knowledge-Aware Testing: 專門的 RAG 流程與文件搜尋,用於評估知識檢索能力。
- Rigorous Grading: 包含一組精煉的任務,包含超過 75 項修正,以確保評估準確性並消除模糊的限制條件。