anonymous-report-421/GPT-as-Policy
GPT as Policy
解決的問題
本專案評估將大型語言模型(GPT-6 Astra)用作機器人控制策略的有效性,具體測試該模型能否直接控制機器人,或作為高級審查員來修正其他策略(如 $\pi_{0.5}$)的動作。
運作原理
本專案實現了兩種主要評估方法:
- GPT-6 Astra Direct:將該模型用作主要控制器來執行任務。
- Hybrid Policy:基礎策略($\pi_{0.5}$)提出動作,GPT-6 Astra 審查這些動作,並在執行前可選地進行修正。
這些策略在十個 RoboDojo 任務中進行測試。系統與模擬器(Isaac Sim 5.1)和策略伺服器整合,以執行 rollout 並記錄成功率和分數。
適用對象
適用於研究前沿 LLM 如何用於機器人控制和動作修正的具身 AI 和機器人領域的研究人員和開發者。
亮點
- 混合修正方法:證明了混合策略(基礎策略 + GPT 修正)優於 LLM 直接控制。
- 效能指標:在 RoboDojo 任務中,混合模式的成功率為 48%,而直接模式為 26%。
- 整合:提供了將 LLM 連接到 RoboDojo 和 RoboLab 環境的框架。
- 推理能力:在策略執行中利用 GPT-6 Astra 的
xhigh推理設定。
相關
- 專案
- 專案
- 專案
- 專案