anonymous-report-421/GPT-as-Policy

GPT as Policy

解決する課題

本プロジェクトでは、大規模言語モデル(GPT-6 Astra)をロボットの制御ポリシーとして使用する有効性を評価します。具体的には、モデルがロボットを直接制御できるか、あるいは別のポリシー($\pi_{0.5}$ など)のアクションを修正する上位レビュアーとして機能できるかをテストします。

仕組み

本プロジェクトでは、主に以下の2つの評価手法を実装しています:

  1. GPT-6 Astra Direct: モデルをプライマリコントローラーとして使用し、タスクを実行します。
  2. Hybrid Policy: ベースポリシー($\pi_{0.5}$)がアクションを提案し、GPT-6 Astra がこれらのアクションをレビューし、必要に応じて実行前に修正します。

これらのポリシーは、10つの RoboDojo タスクにわたってテストされます。システムはシミュレーター(Isaac Sim 5.1)およびポリシーサーバーと統合され、ロールアウトを実行し、成功率とスコアを記録します。

対象者

フロンティアLLMがロボットの制御やアクション修正にどのように使用できるかを研究している、エンボディドAIおよびロボティクス分野の研究者や開発者向けです。

ハイライト

  • Hybrid Correction Approach: ハイブリッドポリシー(ベースポリシー + GPT修正)が、LLMの直接制御よりも優れたパフォーマンスを発揮することを示しています。
  • Performance Metrics: RoboDojo タスクにおいて、ハイブリッドモードでは48%、直接モードでは26%の成功率を達成しています。
  • Integration: LLMを RoboDojo および RoboLab 環境に接続するためのフレームワークを提供します。
  • Reasoning Capabilities: ポリシーの実行において、GPT-6 Astra の xhigh 推論設定を利用しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト