anonymous-report-421/GPT-as-Policy

GPT as Policy

解决的问题

本项目评估将大语言模型(GPT-6 Astra)用作机器人控制策略的有效性,具体测试该模型能否直接控制机器人,或作为高级审查员来修正其他策略(如 $\pi_{0.5}$)的动作。

工作原理

本项目实现了两种主要评估方法:

  1. GPT-6 Astra Direct:将该模型用作主要控制器来执行任务。
  2. Hybrid Policy:基础策略($\pi_{0.5}$)提出动作,GPT-6 Astra 审查这些动作,并在执行前可选地进行修正。

这些策略在十个 RoboDojo 任务中进行测试。系统与模拟器(Isaac Sim 5.1)和策略服务器集成,以执行 rollout 并记录成功率和分数。

适用人群

适用于研究前沿 LLM 如何用于机器人控制和动作修正的具身 AI 和机器人领域的研究人员和开发者。

亮点

  • 混合修正方法:证明了混合策略(基础策略 + GPT 修正)优于 LLM 直接控制。
  • 性能指标:在 RoboDojo 任务中,混合模式的成功率为 48%,而直接模式为 26%。
  • 集成:提供了将 LLM 连接到 RoboDojo 和 RoboLab 环境的框架。
  • 推理能力:在策略执行中利用 GPT-6 Astra 的 xhigh 推理设置。

相关

  • 项目
  • 项目
  • 项目
  • 项目