sierra-research/tau2-bench

τ-Bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains

What it solves

$ au$-Bench 提供了一种标准化的方式来评估 AI 客服代理人处理真实交互的水平。它解决了测试代理人必须遵循严格政策、使用外部工具,并在不同模态(文本和语音)进行复杂、多轮对话中与用户进行交互的难度。

How it works

该框架模拟了代理人与用户模拟器之间的交互。它定义了特定的 ""domain""(例如:航空、零售、电信、银行),其中每个 domain 包含代理人必须遵循的一组操作政策、它能调用的工具,以及一系列需要完成的任务。

它支持两种主要的通信模式:

  • Text (half-duplex): 传统的基于回合的聊天。
  • Voice (full-duplex): 使用 OpenAI、Gemini 和 xAI 等提供商进行实时、同步的音频交互。

此外,它还包括一个专门的知识领域用于测试 RAG (Retrieval-Augmented Generation) 能力,允许代理人搜索非结构化文档以解决客户问题。

Who it's for

  • Agent Developers: 需要验证其代理人遵循政策和工具使用准确性的客服 AI 开发人员。
  • AI Researchers: 研究 LLM-based 代理人在工具密集型、多轮环境中的可靠性的研究人员。
  • RL Practitioners: 使用提供的 Gymnasium-compatible 接口来通过强化学习训练代理人的开发人员。

Highlights

  • Multimodal Evaluation: 支持文本基础和端到端音频原生语音交互。
  • Diverse Real-World Domains: 为航空、零售、电信、银行行业预置了场景。
  • Knowledge-Aware Testing: 专门的 RAG 流程和文档搜索用于评估知识检索能力。
  • Rigorous Grading: 包含一套精炼的任务集,包含超过 75 项修复,以确保评估准确性并消除模糊的约束条件。