nicklashansen/tdmpc2
Code for "TD-MPC2: Scalable, Robust World Models for Continuous Control"
해결하는 문제
TD-MPC2는 연속 제어 작업을 위한 견고하고 확장 가능한 에이전트를 생성하도록 설계되었습니다. 이는 단일 하이퍼파라미터 세트를 사용하여 다양한 환경(로봇 공학 및 물리 시뮬레이션 등)에서 잘 작동하는 에이전트를 훈련하는 문제를 해결하여, 작업마다 수행해야 하는 번거로운 튜닝의 필요성을 줄여줍니다.
작동 원리
TD-MPC2는 월드 모델(world models)을 사용하여 미래의 상태와 보상을 예측하는 모델 기반 강화 학습 알고리즘입니다. 단일 작업 온라인 강화 학습(경험을 통한 학습)과 멀티 태스크 오프라인 강화 학습(사전 수집된 데이터 세트를 통한 학습)을 모두 지원합니다. 이 시스템은 상태 기반 관측과 픽셀 기반(RGB) 관측을 모두 처리할 수 있으며, 3억 1,700만 개의 파라미터를 가진 모델까지 확장하여 다양한 도메인과 Embodiment에 걸친 수십 개의 작업을 처리할 수 있습니다.
대상
이 프로젝트는 로봇 공학, Embodied Intelligence 및 강화 학습 분야에서 연구하는 연구자와 개발자, 특히 연속 제어 및 멀티 태스크 학습에 집중하는 분들을 위한 것입니다.
주요 특징
- 폭넓은 호환성: DMControl, Meta-World, ManiSkill2 및 MyoSuite의 104개 연속 제어 작업을 지원합니다.
- 확장성: 단일 에이전트(최대 317M 파라미터)를 훈련하여 80개의 서로 다른 작업을 수행할 수 있습니다.
- 다재다능함: 상태 및 픽셀 관측 모두에서 작동합니다.
- 견고함: 단일 하이퍼파라미터 세트를 사용하여 모델 프리 및 모델 기반 방법과 경쟁력 있는 성능을 보여줍니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트