nicklashansen/tdmpc2
Code for "TD-MPC2: Scalable, Robust World Models for Continuous Control"
解決する課題
TD-MPC2は、連続制御タスクのための堅牢でスケーラブルなエージェントを構築するために設計されています。これは、単一のハイパーパラメータセットを使用して、幅広い環境(ロボット工学や物理シミュレーションなど)で優れたパフォーマンスを発揮するエージェントを訓練するという課題に対処し、タスクごとの煩雑なチューニングの必要性を軽減します。
仕組み
TD-MPC2は、世界モデル(world models)を使用して将来の状態と報酬を予測するモデルベース強化学習アルゴリズムです。単一タスクのオンライン強化学習(経験からの学習)と、マルチタスクのオフライン強化学習(収集済みデータセットからの学習)の両方をサポートしています。このシステムは、状態ベースの観測とピクセルベース(RGB)の観測の両方を処理でき、3億1700万個のパラメータを持つモデルまでスケールアップして、異なるドメインやエンボディメントにわたる数十のタスクを処理できます。
対象者
このプロジェクトは、ロボット工学、エンボディド・インテリジェンス、および強化学習の研究者や開発者、特に連続制御とマルチタスク学習に焦点を当てている方を対象としています。
ハイライト
- 幅広い互換性: DMControl、Meta-World、ManiSkill2、およびMyoSuiteにわたる104の連続制御タスクをサポート。
- スケーラビリティ: 単一のエージェント(最大3億1700万パラメータ)を訓練して、80の異なるタスクを実行可能。
- 汎用性: 状態ベースおよびピクセルベースの観測の両方に対応。
- 堅牢性: 単一のハイパーパラメータセットを使用して、モデルフリーおよびモデルベースの手法に対して競争力のあるパフォーマンスを発揮。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト