Qwen-AgentWorld 릴리스: 7개 도메인을 위한 언어 세계 모델 및 일반 에이전트에 대한 영향
TL;DR
Qwen은 Qwen‑AgentWorld를 출시합니다. 이는 단일 모델 내에서 텍스트‑ 및 GUI‑ 기반 에이전트 환경 7가지를 시뮬레이션하는 네이티브 언어 세계 모델이며, 새로운 AgentWorldBench 벤치마크에서 최첨단 시뮬레이션 품질을 달성했습니다. 이 모델은 두 가지 보완적인 방법으로 일반 에이전트를 향상시킵니다: 강화 학습을 위한 제어 가능한 시뮬레이터 역할, 그리고 다음 상태 예측을 내재화한 통합 기반 모델 역할.
Overview of Qwen‑AgentWorld
What it is – Qwen‑AgentWorld는 현재 상호작용 히스토리와 에이전트 행동을 입력으로 받아 환경의 다음 관찰을 예측하도록 학습된 언어 세계 모델(LWM)입니다. 사후에 일반 목적 LLM을 미세조정하는 기존 방식과 달리, Qwen‑AgentWorld는 지속적 사전학습(CPT) 단계부터 감독 미세조정(SFT) 및 강화 학습(RL) 단계까지 환경 모델링을 명시적 목표로 포함합니다.
Scope – 모델은 다음 7가지 상호작용 도메인을 포괄합니다:
- 텍스트‑기반: 터미널, 검색, MCP(툴‑콜 API), 소프트웨어 엔지니어링(IDE/코드 편집).
- GUI‑기반: 웹 브라우저, 데스크톱 OS, 안드로이드 UI. GUI 도메인에서는 모델이 원시 픽셀 대신 구조화된 렌더링 가능한 코드(HTML, 접근성‑트리 XML, UI 계층)를 예측하므로 순수 텍스트 시뮬레이션이 가능합니다.
Benchmarks – 모델과 함께 팀은 AgentWorldBench를 공개합니다. 이는 7개 도메인 평가 스위트로, 각 시뮬레이션 궤적을 실제 환경에서 얻은 정답 관찰과 짝지어 평가합니다. 점수는 포맷, 사실성, 일관성, 현실감, 품질의 5차원 루브릭을 LLM이 판단해 산출합니다.
Training Pipeline
1. Continual Pre‑Training (CPT)
- 샌드박스, 에뮬레이터, 오픈소스 벤치마크에서 수집한 1천만 개 이상의 실제 상호작용 궤적을 주입합니다.
- 산업 제어, 사이버 보안, 법률, 의료, 금융, 시사 등 특화된 세계 지식 코퍼스로 궤적을 보강합니다.
- 실제 환경 정보를 담고 있는 턴에 학습을 집중하도록 턴‑레벨 정보이론 손실 마스킹을 적용합니다.
2. Supervised Fine‑Tuning (SFT)
- `` 블록을 사용해 명시적인 다음‑상태 예측 패턴을 도입합니다.
- 거절 샘플링을 통해 고품질 사고 궤적을 선택해 7,094개의 SFT 샘플을 확보합니다.
3. Reinforcement Learning (RL)
- GSPO RL로 충실도를 강화합니다.
- 보상은 루브릭 기반 LLM 심판(다차원 품질)과 정확히 검증 가능한 도메인에 대한 규칙 기반 검증자를 결합합니다.
Performance on AgentWorldBench
| Model | Overall Score | Notable Domains |
|---|---|---|
| Qwen‑AgentWorld‑397B‑A17B | 58.71 (highest) | 터미널, SWE(큰 폭의 향상) |
| GPT‑5.4 | 58.25 | – |
| Claude Opus 4.8 | – | – |
| Gemini 3.1 Pro | – | – |
35 B‑A3B 규모에서 3단계 파이프라인은 전체 평균을 47.73에서 56.39(+8.66)로 끌어올려 Claude Sonnet 4.6(56.04)을 앞섭니다. 텍스트와 GUI 도메인 모두에서 일관된 향상이 관찰됩니다.
Emergent Reasoning Patterns
텍스트 도메인 4곳에서 129개의 사고 추적을 분석한 결과, 세 가지 뚜렷한 패턴이 드러났습니다:
- Deliberative self‑correction – 모델이 중간 예측을 수정하기 위해 “Wait!” 인터럽트를 삽입하며, 턴당 평균 10.4개의 인터럽트를 발생시킵니다.
- Information leakage prevention – 검색 도메인에서 질의와 무관한 경우 목표 답변 스니펫을 숨겨 이론‑심리적 행동을 모방합니다.
- Multi‑step causal reasoning –
curl -s localhost:3000 | python3 -m json.tool와 같은 복합 파이프라인을 예측하려면 6단계 논리 체인이 필요하지만, 모델이 이를 성공적으로 수행합니다.
Paradigm I: Decoupled Simulation for RL
Why simulate?
- Scalability & controllability: LWM은 샌드박스 인프라 없이 무제한 턴‑레벨 상호작용을 생성하고, 희귀하거나 적대적인 교란을 주입할 수 있습니다.
- Internal planning: 에이전트가 행동 전에 세계 모델을 사용해 결과를 정신적으로 시뮬레이션할 수 있으며, 이는 순수 정책 학습에서는 제공되지 않는 능력입니다.
Key Findings
- Zero‑shot generalization: 훈련에 보이지 않은 4 k OpenClaw 환경을 시뮬레이션하면 Claw‑Eval에서 +4.3, QwenClawBench에서 +7.1을 기록합니다.
- Controlled simulation matters: 제어되지 않은 Sim‑RL은 거의 향상이 없으며, 자연어 제어 명령을 추가하면 MCPMark가 +12.3, Tool Decathlon이 +3.7 상승합니다.
- Surpassing real‑environment RL: WideSearch에서 제어 가능한 Sim‑RL은 50.3 % F1(60스텝)으로, 실시간 검색 엔진에서 훈련된 RL의 45.6 %를 능가합니다.
- Behavioral shaping: 제어 가능한 시뮬레이션은 에이전트가
web_extractor호출을 늘리게 하여 더 깊은 스니펫 추출에 의존하도록 학습합니다.
Fictional‑World Experiments
1 k 자체 포함 가상 데이터베이스를 만들면 에이전트가 시뮬레이션 검색 툴에 의존하게 됩니다. 제어된 Sim‑RL은 35 B 모델의 Item‑F1을 34.02에서 50.31(+16.29)로, Row‑F1을 13.72에서 24.21(+10.49)로 향상시킵니다.
Paradigm II: Unified Agent Foundation Model
이 패러다임에서는 동일한 LWM이 행동을 선택하고 다음 관찰을 예측하여 세계 모델링을 메타‑추론 스킬로 내재화합니다.
Transfer Results
단일 턴, 비에이전트 RL 과제(툴 호출 없음)에서 LWM을 훈련하면 7개 도메인 전부와 3개의 OOD 세트에 걸쳐 다중 턴, 툴‑콜 벤치마크에 교차‑과제 일반화가 나타납니다:
| Benchmark (out‑of‑domain) | Base Score | LWM‑RL Score | Δ |
|---|---|---|---|
| Claw‑Eval | 33.3 | 39.6 | +6.3 |
| QwenClawBench | 64.5 | 67.9 | +3.4 |
| BFCL v4 | 42.2 | 47.4 | +5.2 |
| WideSearch (F1 Item) | 33.4 | 46.2 | +12.8 |
| … | … | … | … |
| 이러한 개선은 목표 에이전트 과제에 대한 RL 미세조정 없이도 이루어지며, 다음‑상태 예측이 강력한 기반 스킬이 될 수 있음을 보여줍니다. |
Deployment Details
- Model sizes: 35 B‑A3B(MoE, 3 B 활성 파라미터) 및 397 B‑A17B.
- Context window: 256 K 토큰.
- Serving: SGLang 및 vLLM과 호환됩니다. 예시 명령:
# SGLang
python -m sglang.launch_server \
--model-path Qwen/Qwen-AgentWorld-35B-A3B \
--port 8000 \
--tensor-parallel-size 4 \
--context-length 262144 \
--reasoning-parser qwen3
# vLLM
vllm serve Qwen/Qwen-AgentWorld-35B-A3B \
--port 8000 \
--tensor-parallel-size 4 \
--max-model-len 262144 \
--reasoning-parser qwen3 \
--trust-remote-code
- Evaluation pipeline:
eval/eval.py는 추론, LLM‑기반 심판, 5가지 루브릭 차원에 대한 집계를 수행합니다.
Implications for General Agents
- Complementary scaling axis – LWM은 실제 환경 상호작용을 대체하지 않고 보완하는 제어 가능하고 확장 가능한 시뮬레이션 레이어를 제공합니다.
- Unified reasoning – 에이전트에 다음‑상태 예측을 내재화하면 반사적 계획과 유사한 정신‑시뮬레이션 능력이 생겨 지시 수행, 장기 컨텍스트 처리, 도메인 지식 활용이 강화됩니다.
- Cross‑domain transfer – 다양한 궤적에 대한 학습은 공유 모델링 스킬을 형성해 미보유 도메인에서도 성능을 끌어올려 도메인‑특화 데이터 필요성을 감소시킵니다.
- Research roadmap – Qwen‑AgentWorld는 언어‑전용 세계 모델링이 최첨단 모델 성능에 도달하고 이를 넘어설 수 있음을 증명하며, 보다 능력 있는 범용 자율 에이전트로 나아가는 길을 열어줍니다.
Citation
@article{zuo2026qwen,
title = {Qwen‑agentworld: language world models for general agents},
author = {Zuo, Yuxin and Xiao, Zikai and Sheng, Li and Huang, Fei and Tu, Jianhong and Liu, Yuxuan and Tang, Tianyi and Hu, Xiaomeng and Su, Yang and Lan, Qingfeng and others},
journal = {arXiv preprint arXiv:2606.24597},
year = {2026}
}