sierra-research/tau2-bench
τ-Bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains
What it solves
$ au$-Bench 提供了一种标准化的方式来评估 AI 客服代理人处理真实交互的水平。它解决了测试代理人必须遵循严格政策、使用外部工具,并在不同模态(文本和语音)进行复杂、多轮对话中与用户进行交互的难度。
How it works
该框架模拟了代理人与用户模拟器之间的交互。它定义了特定的 ""domain""(例如:航空、零售、电信、银行),其中每个 domain 包含代理人必须遵循的一组操作政策、它能调用的工具,以及一系列需要完成的任务。
它支持两种主要的通信模式:
- Text (half-duplex): 传统的基于回合的聊天。
- Voice (full-duplex): 使用 OpenAI、Gemini 和 xAI 等提供商进行实时、同步的音频交互。
此外,它还包括一个专门的知识领域用于测试 RAG (Retrieval-Augmented Generation) 能力,允许代理人搜索非结构化文档以解决客户问题。
Who it's for
- Agent Developers: 需要验证其代理人遵循政策和工具使用准确性的客服 AI 开发人员。
- AI Researchers: 研究 LLM-based 代理人在工具密集型、多轮环境中的可靠性的研究人员。
- RL Practitioners: 使用提供的 Gymnasium-compatible 接口来通过强化学习训练代理人的开发人员。
Highlights
- Multimodal Evaluation: 支持文本基础和端到端音频原生语音交互。
- Diverse Real-World Domains: 为航空、零售、电信、银行行业预置了场景。
- Knowledge-Aware Testing: 专门的 RAG 流程和文档搜索用于评估知识检索能力。
- Rigorous Grading: 包含一套精炼的任务集,包含超过 75 项修复,以确保评估准确性并消除模糊的约束条件。