anonymous-report-421/GPT-as-Policy
GPT as Policy
解决的问题
本项目评估将大语言模型(GPT-6 Astra)用作机器人控制策略的有效性,具体测试该模型能否直接控制机器人,或作为高级审查员来修正其他策略(如 $\pi_{0.5}$)的动作。
工作原理
本项目实现了两种主要评估方法:
- GPT-6 Astra Direct:将该模型用作主要控制器来执行任务。
- Hybrid Policy:基础策略($\pi_{0.5}$)提出动作,GPT-6 Astra 审查这些动作,并在执行前可选地进行修正。
这些策略在十个 RoboDojo 任务中进行测试。系统与模拟器(Isaac Sim 5.1)和策略服务器集成,以执行 rollout 并记录成功率和分数。
适用人群
适用于研究前沿 LLM 如何用于机器人控制和动作修正的具身 AI 和机器人领域的研究人员和开发者。
亮点
- 混合修正方法:证明了混合策略(基础策略 + GPT 修正)优于 LLM 直接控制。
- 性能指标:在 RoboDojo 任务中,混合模式的成功率为 48%,而直接模式为 26%。
- 集成:提供了将 LLM 连接到 RoboDojo 和 RoboLab 环境的框架。
- 推理能力:在策略执行中利用 GPT-6 Astra 的
xhigh推理设置。
相关
- 项目
- 项目
- 项目
- 项目