robocurve/inspect-robots

Open source evals for physical AI. Run any LLM/VLA on any arm/humanoid against any real/sim benchmark.

解決的問題

Inspect Robots 提供了一個物理 AI 的標準化評估框架,讓開發者能在不為每種機器人硬體(身體)或模擬器組合重新撰寫基準測試的情況下,測試機器人策略(例如 LLM 代理或視覺-語言-動作模型)。

工作原理

此框架將任務定義與機器人硬體和 AI 策略分離。它使用插件系統,其中「身體」(如 Franka 或 Unitree G1 的特定機器人適配器)和「策略」(驅動機器人的 AI 模型)作為獨立套件註冊。執行前,系統會進行相容性檢查,確保策略的動作/觀測空間與機器人能力相符。

透過 CLI 或 Python API 執行,內建 Rerun 可視化功能,用於串流傳輸攝影機畫面與遙測資料。每次試驗都會記錄至不可變的 EvalLog,以供審計、離線重新評分與分析。

適用對象

開發 VLA、基於 LLM 的代理或程式碼即策略代理的機器人研究人員與工程師,他們需要一種嚴謹且可重現的方式,在真實硬體或模擬環境中評估其模型。

主要特色

  • 硬體無關: 支援多種真實機器人(透過專用插件或通用 ROS 適配器)與模擬器(如 Isaac Lab)。
  • VLA 原生支援: 內建動作分塊、開環執行與時間整合支援。
  • 可審計日誌: 為每次執行產生具版本的 Schema 日誌與 HTML 報告,包含 LLM 代理的對話記錄。
  • 即時可視化: 與 Rerun 深度整合,支援圖像、3D 姿態與關節時間序列的即時串流。
  • 安全防護: 內建預設範圍限制與變動量限制,防止機器人異常移動。
  • 學習循環: 可將失敗執行總結為 Markdown 格式的「學習」檔案,供後續代理執行時回傳使用。

相關

  • 專案
  • 專案
  • 專案
  • 專案