TeleHuman/PRTS

Official Implementation of "PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations"

해결하는 문제

PRTS (Primitive Reasoning and Tasking System)는 단순히 행동 클로닝에 의존하는 표준 비전-언어-액션(VLA) 모델의 한계를 해결합니다. 기존 모델은 무엇을 해야 하는지를 학습하지만, 현재 상태가 목표에 얼마나 가까운지에 대한 내부 이해가 부족한 경우가 많습니다. PRTS는 모델이 목표 도달 가능성에 대한 감각을 내면화할 수 있도록 하여, 단순히 행동만 학습한 모델보다 새로운 지시를 더 잘 따르고, 개입 상황에서도 더 효과적으로 회복할 수 있도록 합니다.

작동 방식

PRTS는 비전-언어-액션(VLA) 모델의 사전 학습 단계에 보상 없는 대조적 강화학습(RL)을 확장합니다. Qwen3-VL 백본을 사용하며, 행동 손실과 함께 대조적 가치 헤드를 함께 학습시킵니다. 수동으로 구성된 보상 레이블이나 성공 마커가 필요 없이, 오프라인 디모나스트레이션 트래잭터리의 시간적 구조에서만 감독 신호를 추출합니다. 이를 통해 상태-행동과 목표 임베딩의 내적 곱이 목표 점유도를 추적하는 언어 기반 가치 함수를 학습할 수 있으며, 정책이 목표에 가까워질수록 이 값이 증가합니다.

대상 사용자

새로운 지시에 대한 일반화, 장기적인 작업 수행, 다양한 로봇 플랫폼(예: 이중 팔 또는 단일 팔 시스템)에서의 실세계 배포에 대한 강건성을 필요로 하는 비전-언어-액션 모델을 활용하는 로봇 공학 연구자 및 개발자.

주요 특징

  • 보상 레이블 없음: 에피소드별 성공 레이블이나 수작업으로 정제된 보상 데이터셋이 필요 없이 목표 도달 가능성을 학습합니다.
  • 목표 도달 가능성 인식: 백본에 직접 대조적 가치 헤드를 통합하여 모델이 목표 달성까지의 진전을 이해할 수 있도록 합니다.
  • 고효율성: 사용자 정의 CuTe-FlashAttention 커널을 사용하여 사전 학습의 계산 비용을 일반적인 행동 클로닝 수준으로 유지합니다.
  • 강력한 일반화: 시뮬레이션 및 실제 환경 모두에서 새로운 지시 수행 및 분포 외 작업에서 기존 VLA 모델을 크게 능가합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트