robocurve/inspect-robots

Open source evals for physical AI. Run any LLM/VLA on any arm/humanoid against any real/sim benchmark.

何を解決するか

Inspect Robots は、物理AIの標準化された評価フレームワークを提供し、開発者がロボットのハードウェア(身体)やシミュレータの組み合わせごとにベンチマークを再実装せずに、ロボットポリシー(LLMエージェントや視覚言語行動モデルなど)をテストできるようにします。

動作方法

このフレームワークは、タスク定義をロボットハードウェアとAIポリシーから分離します。プラグインシステムを採用しており、「エムボディメント」(FrankaやUnitree G1などの特定ロボット用アダプタ)と「ポリシー」(ロボットを制御するAIモデル)が別々のパッケージとして登録されます。実行前に、ポリシーの行動・観測空間がロボットの能力と一致するかをコンパチビリティチェックで確認します。

CLIまたはPython APIで実行でき、カメラ映像やテレメトリのストリーミングを統合されたRerun可視化で確認できます。すべての試行は、改ざん不可能な EvalLog として記録され、後で再スコアリングや分析が可能になります。

対象ユーザー

VLAs、LLMベースエージェント、コードとしてのポリシーを持つエージェントを開発するロボット研究者やエンジニアで、実機またはシミュレーション上でモデルを厳密かつ再現可能な方法で評価したい人。

特徴

  • ハードウェア非依存: 専用プラグインまたは一般的なROSアダプタを介して幅広い実機ロボットと、Isaac Labなどのシミュレータをサポート。
  • VLAネイティブ: 行動のチャンク化、オープンループ実行、時間的アンサンブルをネイティブでサポート。
  • 監査可能なログ: 各実行ごとにスキーマバージョン付きログとHTMLレポートを生成し、LLMエージェントのトランスクリプトも含む。
  • ライブ可視化: Rerunとの第一級の統合により、画像、3Dポーズ、関節時系列データのリアルタイムストリーミングを可能に。
  • 安全ガードレール: 予期しないロボットの動きを防ぐために、デフォルトの範囲制限と変化量制限を含む。
  • 学習ループ: 失敗した実行をMarkdown形式の「学び」ファイルに要約し、次のエージェント実行に再利用可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト