jiupinjia/rocket-recycling
Rocket-recycling with Reinforcement Learning
解决的问题
本项目提供一个仿真环境和强化学习(RL)智能体,用于解决火箭回收这一复杂的物理问题,特别聚焦于实现类似 SpaceX 火箭回收的稳定悬停和精确着陆。
工作原理
系统使用一个轻量级的 2D 火箭模拟器,其中包含一个带有推力矢量控制引擎的刚体,由强化学习智能体进行控制。智能体使用近端策略优化(PPO)结合广义优势估计(GAE)进行训练。智能体处理物理状态编码(缩放后的位置、速度和方向),从离散动作中选择推力等级和喷管角速度的组合。训练过程包含二次空气阻力,并采用重新设计的奖励系统,根据高度、下降速度和横向对齐情况引导火箭,防止坠毁并确保软着陆。
适用人群
专为对强化学习、控制理论和航空航天仿真感兴趣的科研人员、学生或开发者设计,希望在基于物理的环境中实验 PPO 智能体的人士。
主要亮点
- PPO-Clip 实现:使用归一化优势、熵正则化和基于 KL 的早期停止,实现稳定训练。
- 批量训练:从 32 个独立环境中收集转换数据,提升计算吞吐量。
- 基于物理的仿真:包含二次空气阻力和推力矢量控制引擎模型。
- 实时监控:训练过程中提供实时奖励曲线、移动平均值和周期性模拟预览。
相关
- 项目
- 项目
- 项目
- 项目