anonymous-report-421/GPT-as-Policy
GPT as Policy
해결하는 문제
이 프로젝트는 대규모 언어 모델(GPT-6 Astra)을 로봇 제어 정책으로 사용하는 효과를 평가합니다. 구체적으로, 모델이 로봇을 직접 제어할 수 있는지, 또는 다른 정책(예: $\pi_{0.5}$)의 동작을 수정하는 상위 리뷰어 역할을 할 수 있는지를 테스트합니다.
작동 방식
이 프로젝트는 두 가지 주요 평가 방법을 구현합니다:
- GPT-6 Astra Direct: 모델을 주요 컨트롤러로 사용하여 작업을 실행합니다.
- Hybrid Policy: 베이스 정책($\pi_{0.5}$)이 동작을 제안하고, GPT-6 Astra가 이러한 동작을 검토하여 필요 시 실행 전에 수정합니다.
이러한 정책들은 10개의 RoboDojo 작업을 통해 테스트됩니다. 시스템은 시뮬레이터(Isaac Sim 5.1) 및 정책 서버와 통합되어 롤아웃을 실행하고 성공률과 점수를 기록합니다.
대상 독자
프런티어 LLM이 로봇 제어와 동작 수정에 어떻게 사용될 수 있는지를 연구하는 엔보디드 AI 및 로봇공학 분야의 연구자와 개발자를 위한 것입니다.
하이라이트
- Hybrid Correction Approach: 하이브리드 정책(베이스 정책 + GPT 수정)이 LLM 직접 제어보다 우수한 성능을 발휘함을 보여줍니다.
- Performance Metrics: RoboDojo 작업에서 하이브리드 모드에서는 48%, 직접 모드에서는 26%의 성공률을 달성합니다.
- Integration: LLM을 RoboDojo 및 RoboLab 환경에 연결하기 위한 프레임워크를 제공합니다.
- Reasoning Capabilities: 정책 실행에 GPT-6 Astra의
xhigh추론 설정을 활용합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트