Qwen-AgentWorld: 일반 에이전트를 위한 언어 세계 모델
Qwen-AgentWorld는 관찰과 행동을 기반으로 환경 역학을 예측하도록 설계된 언어 세계 모델의 새로운 클래스를 도입하여 일반 에이전트가 더 효과적으로 추론하고 계획할 수 있게 합니다. 일곱 개의 서로 다른 도메인에서 에이전트 환경을 시뮬레이션함으로써, Qwen-AgentWorld는 강화 학습을 위한 확장 가능한 환경 시뮬레이터이자 하류 에이전트 성능을 향상시키는 기초 모델로서 역할을 합니다.
환경 시뮬레이션을 위한 기초 모델
Qwen-AgentWorld는 Qwen-AgentWorld-35B-A3B와 Qwen-AgentWorld-397B-A17B 두 가지 모델 규모를 제공하며, 이는 장쇄 사고(chain-of-thought) 추론을 사용하여 에이전트 환경을 시뮬레이션할 수 있는 최초의 언어 세계 모델입니다. 이러한 모델은 일곱 개 도메인에서 1천만 개 이상의 환경 상호작용 궤적으로 훈련되었습니다.
Qwen-AgentWorld의 개발은 세 단계 훈련 파이프라인을 따릅니다:
- 연속 사전 학습 (CPT): 이 단계는 상태 전이 동역학과 증강된 전문 코퍼스를 활용하여 범용 세계 모델링 능력을 주입합니다.
- 지도 미세 조정 (SFT): 이 단계는 모델이 다음 상태 예측 추론을 수행할 수 있는 능력을 활성화합니다.
- 강화 학습 (RL): 이 단계는 하이브리드 루브릭-규칙 보상을 사용하는 맞춤형 프레임워크를 활용하여 시뮬레이션 정확도를 향상시킵니다.
AgentWorldBench 평가
언어 세계 모델의 성능을 측정하기 위해 연구자들은 AgentWorldBench를 도입했습니다. 이 포괄적인 벤치마크는 아홉 개의 확립된 벤치마크에서 다섯 개의 프론티어 모델의 실제 세계 상호작용으로부터 구성됩니다. 경험적 결과는 Qwen-AgentWorld가 환경 역학을 시뮬레이션하는 능력에서 기존 프론티어 모델을 유의하게 능가함을 보여줍니다.
세계 모델링을 통한 일반 에이전트 향상
Qwen-AgentWorld는 두 가지 주요 패러다임을 통해 일반 에이전트를 향상시킵니다:
분리된 환경 시뮬레이션
Qwen-AgentWorld는 분리된 환경 시뮬레이터로 작동하여 수천 개의 실제 세계 환경을 확장 가능하고 제어 가능한 방식으로 시뮬레이션할 수 있게 합니다. 에이전트 강화 학습에 사용될 때, 이 접근 방식은 실제 환경에서만 훈련하여 얻은 성능 향상을 초월하는 성능 향상을 제공합니다.
통합 에이전트 기초 모델
세계 모델로서의 훈련은 일반 에이전트에 대한 매우 효과적인 워밍업 역할을 합니다. Qwen-AgentWorld가 통합 에이전트 기초 모델로 사용될 때, 일곱 개의 다양한 에이전트 벤치마크에서 하류 성능이 향상됨을 보여줍니다.
Sources
관련
- Dispatch
- 프로젝트
- Dispatch
- Dispatch
- Dispatch