jiupinjia/rocket-recycling
Rocket-recycling with Reinforcement Learning
何を解決するか
このプロジェクトは、スペースXのロケット回収に類似した安定した浮遊と正確な着陸を実現するという、複雑な物理問題を解決するためのシミュレーション環境と強化学習(RL)エージェントを提供します。
動作方法
システムは、剛体に推力ベクトル制御エンジンを備えた軽量な2Dロケットシミュレータを使用しています。RLエージェントは、一般化されたアドバンテージ推定(GAE)を用いた近接方策最適化(PPO)で訓練されます。エージェントは物理状態の符号化(スケーリングされた位置、速度、向き)を処理し、推力レベルとノズルの角速度の組み合わせから離散的な行動を選択します。訓練プロセスには二次式の空気抵抗と、高度、降下速度、横方向の整合性に基づいてロケットを誘導する再設計された報酬システムが含まれており、衝突を防ぎ、ソフトランディングを確保します。
対象ユーザー
強化学習、制御理論、航空宇宙シミュレーションに興味を持つ研究者、学生、開発者向けに設計されています。物理ベースの環境でPPOエージェントを実験したい方におすすめです。
特徴
- PPO-Clip 実装:正規化されたアドバンテージ、エントロピー正則化、KLベースの早期停止を用いて安定した訓練を実現。
- バッチトレーニング:32個の独立した環境から遷移を収集し、計算スループットを向上。
- 物理ベースのシミュレーション:二次式の空気抵抗と推力ベクトル制御エンジンモデルを含む。
- ライブモニタリング:訓練中にリアルタイムの報酬曲線、移動平均、定期的なシミュレーションプレビューを表示。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト