anonymous-report-421/GPT-as-Policy

GPT as Policy

解決的問題

本專案評估將大型語言模型(GPT-6 Astra)用作機器人控制策略的有效性,具體測試該模型能否直接控制機器人,或作為高級審查員來修正其他策略(如 $\pi_{0.5}$)的動作。

運作原理

本專案實現了兩種主要評估方法:

  1. GPT-6 Astra Direct:將該模型用作主要控制器來執行任務。
  2. Hybrid Policy:基礎策略($\pi_{0.5}$)提出動作,GPT-6 Astra 審查這些動作,並在執行前可選地進行修正。

這些策略在十個 RoboDojo 任務中進行測試。系統與模擬器(Isaac Sim 5.1)和策略伺服器整合,以執行 rollout 並記錄成功率和分數。

適用對象

適用於研究前沿 LLM 如何用於機器人控制和動作修正的具身 AI 和機器人領域的研究人員和開發者。

亮點

  • 混合修正方法:證明了混合策略(基礎策略 + GPT 修正)優於 LLM 直接控制。
  • 效能指標:在 RoboDojo 任務中,混合模式的成功率為 48%,而直接模式為 26%。
  • 整合:提供了將 LLM 連接到 RoboDojo 和 RoboLab 環境的框架。
  • 推理能力:在策略執行中利用 GPT-6 Astra 的 xhigh 推理設定。

相關

  • 專案
  • 專案
  • 專案
  • 專案