Snowflake-Labs/agent-world-model
Agent World Model: Infinity Synthetic Environments for Agentic Reinforcement Learning
What it solves
Agent World Model (AWM)은 도구를 사용하는 에이전트의 훈련 및 평가를 위한 다양하고 실행 가능한 환경의 부족 문제를 해결합니다. 에이전트가 실시간으로 상호작용할 수 있는 수천 개의 고유한 SQL 기반 합성 환경을 자동으로 생성하는 방법을 제공하여, 강화 학습을 통해 멀티턴 도구 사용 능력을 향상시킬 수 있습니다.
How it works
AWM은 다음과 같은 다단계 합성 파이프라인을 사용하여 환경을 생성합니다:
- Scenario Generation: 적은 양의 시드 세트에서 고유한 시나리오 설명을 생성합니다.
- Task Generation: 각 시나리오에 대한 구체적인 사용자 작업을 정의합니다.
- Database Synthesis: SQL 데이터베이스 스키마를 생성하고 작업을 지원하기 위한 샘플 데이터를 채웁니다.
- Interface Synthesis: API 사양을 생성하고 통합된 Model Context Protocol (MCP) 인터페이스를 통해 환경을 노출하는 데 대응하는 Python 코드를 생성합니다.
- Verification Synthesis: 에이전트가 작업을 성공적으로 완료했는지 확인하기 위한 코드 기반 또는 LLM 보조 판사(judges)를 생성합니다.
Who it’s for
이 프로젝트는 에이전트 강화 학습, 도구 사용 평가, 그리고 복잡한 데이터베이스 기반 환경에서 작동해야 하는 LLM 개발에 종사하는 AI 연구자 및 개발자를 위해 설계되었습니다.
Highlights
- Massive Scale: 1,000개의 실행 가능한 SQL 기반 환경을 합성합니다.
- Unified Interface: Model Context Protocol (MCP)를 사용하여 일관된 도구 상호작용을 지원합니다.
- RL-Ready:
meta-pytorch/OpenEnv와 통합되어 대규모 에이전트 RL 훈련을 지원합니다. - Automated Verification: 순수 코드 기반 및 LLM-as-a-Judge 검증 방법을 모두 포함합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch