QwenLM/Qwen-AgentWorld
Qwen-AgentWorld: Language World Models for General Agents
해결하는 문제
Qwen-AgentWorld는 에이전트 환경을 시뮬레이션하도록 설계되어, AI 에이전트가 실제 시스템에 액세스할 필요 없이 훈련하거나 테스트할 수 있도록 합니다. 다양한 디지털 환경에 대한 고충실도 및 제어 가능한 시뮬레이션을 제공함으로써 에이전트 훈련의 확장성 문제를 해결하며, 이는 강화 학습(RL)을 위한 합성 데이터 생성 및 인도메인(in-domain) 및 아웃도메인(out-of-domain) 작업 모두에서 에이전트 성능을 향상시키는 데 사용될 수 있습니다.
작동 방식
1,000만 개 이상의 실제 상호작용 궤적(trajectories)으로 훈련된 네이티브 언어 월드 모델입니다. 이 모델은 다음과 같은 3단계 훈련 파이프라인을 사용합니다:
- CPT (Continual Pre-training): 환경 지식을 주입합니다.
- SFT (Supervised Fine-Tuning): 긴 사고 사슬(chain-of-thought)을 통해 다음 상태 예측 추론을 활성화합니다.
- RL (Reinforcement Learning): 시뮬레이션 충실도를 정교화합니다.
기존 시뮬레이터와 달리, MCP, Search, Terminal, SWE (Software Engineering), Android, Web, OS의 7가지 통합 도메인을 시뮬레이션할 수 있는 단일 모델입니다.
대상
이 프로젝트는 라이브 시스템과의 상호작용에 따른 위험이나 비용 없이 훈련(Sim RL) 및 평가(AgentWorldBench)를 위한 확장 가능하고 제어 가능한 환경이 필요한 자율 에이전트를 구축하는 AI 연구자 및 개발자를 위한 것입니다.
주요 특징
- 7가지 통합 도메인: MCP, Search, Terminal, SWE, Android, Web, OS를 하나의 모델에서 시뮬레이션합니다.
- 네이티브 월드 모델: 환경 모델링은 사후 추가가 아니라 처음부터 훈련 목표로 설정됩니다.
- 제어 가능한 시뮬레이션: 에이전트의 스트레스 테스트를 위한 섭동(perturbations) 주입 또는 가상 세계 생성을 지원합니다.
- 에이전트 파운데이션 모델: 월드 모델로서의 훈련은 모델 자체의 멀티턴 도구 호출 작업 수행 능력을 향상시킵니다.
- AgentWorldBench: 형식, 사실성, 일관성, 현실성 및 품질을 기준으로 점수를 매기는 7개 도메인에 걸친 포괄적인 평가 벤치마크를 포함합니다.
관련
- Dispatch
- Dispatch
- 프로젝트
- 프로젝트
- 프로젝트