QwenLM/Qwen-AgentWorld
Qwen-AgentWorld: Language World Models for General Agents
解決する課題
Qwen-AgentWorldは、エージェント環境をシミュレートするように設計されており、AIエージェントが実世界のシステムにアクセスすることなくトレーニングやテストを行うことを可能にします。さまざまなデジタル環境の高忠実度で制御可能なシミュレーションを提供することで、エージェントのトレーニングのスケールアップという問題に対処し、強化学習(RL)のための合成データの生成や、インドメインおよびアウトドメインの両方のタスクにおけるエージェントのパフォーマンス向上に役立てることができます。
仕組み
1,000万件以上の実世界のインタラクション・トラジェトリでトレーニングされたネイティブ言語ワールドモデルです。このモデルは、以下の3段階のトレーニングパイプラインを使用します:
- CPT (Continual Pre-training): 環境知識を注入します。
- SFT (Supervised Fine-Tuning): 長い思考の連鎖(chain-of-thought)を介して次状態予測の推論を活性化します。
- RL (Reinforcement Learning): シミュレーションの忠実度を研ぎ澄ませます。
従来のシミュレーターとは異なり、MCP、Search、Terminal、SWE (Software Engineering)、Android、Web、OSの7つの統合されたドメインをシミュレートできる単一のモデルです。
対象者
このプロジェクトは、ライブシステムとのインタラクションに伴うリスクやコストを回避しながら、トレーニング(Sim RL)と評価(AgentWorldBench)のためのスケーラブルで制御可能な環境を必要とする、自律型エージェントを構築するAI研究者および開発者向けです。
ハイライト
- 7つの統合ドメイン: MCP、Search、Terminal、SWE、Android、Web、OSを1つのモデルでシミュレートします。
- ネイティブワールドモデル: 環境モデリングは、事後的な追加ではなく、最初からトレーニングの目的として組み込まれています。
- 制御可能なシミュレーション: 摂動の注入や、エージェントのストレス・テストのための架空の世界の作成をサポートします。
- エージェント基盤モデル: ワールドモデルとしてのトレーニングは、モデル自身のマルチターン・ツール呼び出しタスクの実行能力を向上させます。
- AgentWorldBench: フォーマット、事実性、一貫性、リアリズム、品質に基づいてスコアリングする、7つのドメインにわたる包括的な評価ベンチマークが含まれています。
関連
- Dispatch
- Dispatch
- プロジェクト
- プロジェクト
- プロジェクト