sierra-research/tau2-bench
τ-Bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains
What it solves
$\tau$-Bench는 AI 고객 서비스 에이전트가 실제 환경의 상호작용을 얼마나 잘 처리하는지 평가하기 위한 표준화된 방법을 제공합니다. 엄격한 정책을 따르고, 외부 도구를 사용하며, 다양한 모달리티(텍스트 및 음성)를 통해 복잡한 멀티턴 대화를 통해 사용자와 상호작용해야 하는 에이전트 테스트의 어려움을 해결합니다.
How it works
이 프레임워크는 에이전트와 사용자 시뮬레이터 간의 상호작용을 시뮬레이션합니다. 특정 ""domain""(예: 항공, 소매, 통신, 뱅킹)을 정의하며, 각 domain은 에이전트가 따라야 하는 일련의 운영 정책, 호출할 수 있는 도구, 그리고 완료해야 할 일련의 작업들을 포함합니다.
두 가지 주요 통신 모드를 지원합니다:
- Text (half-duplex): 전통적인 턴 기반 채팅.
- Voice (full-duplex): OpenAI, Gemini, xAI와 같은 제공업체를 사용하여 실시간 동시 오디오 상호작용.
또한, RAG (Retrieval-Augmented Generation) 능력을 테스트하기 위한 특수 지식 도메인을 포함하여, 에이전트가 비정형 문서를 검색하여 고객 문제를 해결할 수 있도록 합니다.
Who it's for
- Agent Developers: 고객 서비스를 위한 대화형 AI를 구축하며 에이전트의 정책 준수 및 도구 사용 정확성을 검증해야 하는 개발자.
- AI Researchers: 도구 사용이 많은 멀티턴 환경에서 LLM-based 에이전트의 신뢰성을 연구하는 연구자.
- RL Practitioners: 제공된 Gymnasium-compatible 인터페이스를 사용하여 강화 학습을 통해 에이전트를 훈련하는 개발자.
Highlights
- Multimodal Evaluation: 텍스트 기반 및 엔드투엔드 오디오 네이티브 음성 상호작용을 모두 지원.
- Diverse Real-World Domains: 항공, 소매, 통신, 뱅킹 산업을 위한 사전 구축된 시나리오.
- Diverse Real-World Domains: 항공, 소매, 통신, 뱅킹 산업을 위한 사전 구축된 시나리오.
- Knowledge-Aware Testing: 지식 검색을 평가하기 위한 전용 RAG 파이프라인 및 문서 검색.
- Rigorous Grading: 평가 정확성을 보장하고 모호한 제약 조건을 제거하기 위해 75개 이상의 수정 사항이 반영된 정교한 작업 세트를 포함합니다.