jiupinjia/rocket-recycling

Rocket-recycling with Reinforcement Learning

解決的問題

本專案提供一個模擬環境與強化學習(RL)代理,用以解決火箭回收這項複雜的物理問題,特別聚焦於實現類似 SpaceX 火箭回收的穩定懸停與精準著陸。

工作原理

系統使用輕量級的 2D 火箭模擬器,其中包含一個具備推力向量控制引擎的剛體,由強化學習代理進行控制。代理使用近端策略優化(PPO)結合廣義優勢估計(GAE)進行訓練。代理處理物理狀態編碼(縮放後的位置、速度與方向),從離散動作中選擇推力等級與噴嘴角速度的組合。訓練過程包含二次空氣阻力,並採用重新設計的獎勵系統,根據高度、下降速度與橫向對齊情況引導火箭,防止墜毀並確保軟著陸。

適用對象

專為對強化學習、控制理論與航太模擬感興趣的研究人員、學生或開發者設計,希望在基於物理的環境中實驗 PPO 代理的人士。

主要亮點

  • PPO-Clip 實作:使用歸一化優勢、熵正則化與基於 KL 的早期停止,實現穩定訓練。
  • 批量訓練:從 32 個獨立環境中收集轉移資料,提升計算吞吐量。
  • 基於物理的模擬:包含二次空氣阻力與推力向量控制引擎模型。
  • 即時監控:訓練過程中提供即時獎勵曲線、移動平均值與定期模擬預覽。

相關

  • 專案
  • 專案
  • 專案
  • 專案