nicklashansen/tdmpc2
Code for "TD-MPC2: Scalable, Robust World Models for Continuous Control"
解決的問題
TD-MPC2 旨在為連續控制任務創建魯棒且可擴展的智能體。它解決了使用單套超參數在廣泛環境(如機器人技術和物理模擬)中訓練高性能智能體的挑戰,減少了為每個任務進行繁瑣調優的需求。
工作原理
TD-MPC2 是一種模型驅動的強化學習演算法,它使用世界模型(world models)來預測未來的狀態和獎勵。它同時支持單任務在線強化學習(從經驗中學習)和多任務離線強化學習(從預先收集的數據集中學習)。該系統可以處理基於狀態和基於像素(RGB)的觀測,並且可以擴展到擁有 3.17 億個參數的模型,以處理跨不同領域和具身智能的數十個任務。
適用對象
本項目面向機器人技術、具身智能和強化學習領域的科研人員和開發人員,特別是那些專注於連續控制和多任務學習的人士。
亮點
- 廣泛的兼容性:支持 DMControl、Meta-World、ManiSkill2 和 MyoSuite 中的 104 個連續控制任務。
- 可擴展性:能夠訓練單個智能體(高達 3.17 億參數)來執行 80 個不同的任務。
- 多功能性:同時適用於基於狀態和基於像素的觀測。
- 魯棒性:使用單套超參數即可在無模型(model-free)和基於模型(model-based)的方法中表現出競爭力。
相關
- 專案
- 專案
- 專案
- 專案
- 專案