jiupinjia/rocket-recycling
Rocket-recycling with Reinforcement Learning
해결하는 문제
이 프로젝트는 스페이스X 로켓 회수와 유사한 안정적인 부상과 정밀 착륙을 달성하는 것을 목표로 하며, 로켓 회수라는 복잡한 물리 문제를 해결하기 위한 시뮬레이션 환경과 강화학습(RL) 에이전트를 제공합니다.
작동 방식
시스템은 강체에 추진력 벡터 조절 엔진을 장착한 경량 2D 로켓 시뮬레이터를 사용합니다. 에이전트는 일반화된 이득 추정(GAE)을 사용한 근접 정책 최적화(PPO)로 훈련됩니다. 에이전트는 물리적 상태 인코딩(스케일링된 위치, 속도, 방향)을 처리하여 추진력 수준과 노즐 각속도의 조합으로 이루어진 이산 행동을 선택합니다. 훈련 과정에는 2차 공기 저항과 함께, 고도, 하강 속도, 횡방향 정렬을 기반으로 로켓을 유도하는 재설계된 보상 시스템이 포함되어 충돌을 방지하고 부드러운 착륙을 보장합니다.
대상 사용자
강화학습, 제어 이론, 항공우주 시뮬레이션에 관심이 있는 연구자, 학생, 개발자에게 적합하며, 물리 기반 환경에서 PPO 에이전트를 실험하고자 하는 분들에게 추천합니다.
주요 특징
- PPO-Clip 구현: 정규화된 이득, 엔트로피 정규화, KL 기반 조기 중단을 사용하여 안정적인 훈련을 구현.
- 배치 훈련: 32개의 독립된 환경에서 전이를 수집하여 계산 처리량을 향상.
- 물리 기반 시뮬레이션: 2차 공기 저항과 추진력 벡터 조절 엔진 모델 포함.
- 실시간 모니터링: 훈련 중 실시간 보상 곡선, 이동 평균, 주기적인 시뮬레이션 미리보기 기능 제공.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트