robocurve/inspect-robots
Open source evals for physical AI. Run any LLM/VLA on any arm/humanoid against any real/sim benchmark.
해결하는 문제
Inspect Robots는 물리적 AI를 위한 표준화된 평가 프레임워크를 제공하여, 개발자가 LLM 에이전트나 비전-언어-액션(VLA) 모델과 같은 로봇 정책을 다양한 로봇 하드웨어(신체) 또는 시뮬레이터에서 테스트할 수 있도록 합니다. 각 조합마다 벤치마크를 다시 작성할 필요 없이 말이죠.
작동 방식
이 프레임워크는 작업 정의를 로봇 하드웨어와 AI 정책에서 분리합니다. 플러그인 시스템을 사용하며, "에보디먼트"(Franka나 Unitree G1 같은 특정 로봇용 어댑터)와 "정책"(로봇을 제어하는 AI 모델)이 별도의 패키지로 등록됩니다. 실행 전에 정책의 행동/관측 공간이 로봇의 능력과 일치하는지 확인하는 호환성 검사를 수행합니다.
CLI 또는 Python API를 통해 실행되며, 카메라 스트리밍과 텔레메트리 데이터를 통합한 Rerun 시각화 기능이 내장되어 있습니다. 모든 시험은 변경 불가능한 EvalLog로 기록되어, 후속 검토 및 재평가가 가능합니다.
대상 사용자
VLAs, LLM 기반 에이전트, 또는 코드 기반 정책 에이전트를 개발하는 로봇 연구자 및 엔지니어로서, 실제 하드웨어나 시뮬레이션에서 모델을 엄격하고 재현 가능한 방식으로 평가하고자 하는 분들.
주요 특징
- 하드웨어 독립성: 전용 플러그인 또는 일반적인 ROS 어댑터를 통해 다양한 실제 로봇과 Isaac Lab 같은 시뮬레이터를 지원합니다.
- VLA 네이티브: 행동 청크화, 오픈루프 실행, 시간적 앙상블을 내장 지원합니다.
- 감사 가능한 로깅: 각 실행마다 스키마 버전이 있는 로그와 HTML 리포트를 생성하며, LLM 에이전트의 대화 기록도 포함합니다.
- 실시간 시각화: Rerun과의 최고 수준의 통합을 통해 이미지, 3D 자세, 관절 시계열 데이터를 실시간 스트리밍할 수 있습니다.
- 안전 가드레일: 예기치 않은 로봇 동작을 방지하기 위해 기본 범위 제한과 변화량 제한을 포함합니다.
- 학습 루프: 실패한 실행을 마크다운 형식의 "학습" 파일로 요약하여 다음 에이전트 실행에 다시 전달할 수 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트