Anthropic Claude 로보틱스 평가: 고수준 제어에서는 급속한 성과를 보이나 직접 토크 제어는 제한적이다
요약
Anthropic의 2026년 7월 로보틱스 벤치마크는 최신 Claude 모델이 사전 훈련된 이동 및 조작 정책을 성공적으로 안내하여 실제 세계 작업을 수행할 수 있음을 보여주지만, 직접적인 모터 토크나 힘을 지시하라는 요청에는 여전히 실패한다는 점을 밝혔다.
주요 발견: 제어 인터페이스가 성능을 결정한다
- 인터페이스는 모델 크기만큼 중요하다. 동일한 Claude 모델이 직접 토크를 지시할 때는 거의 0점에 가까운 성과를 보일 수 있지만, 사전 훈련된 정책을 감시할 때는 Embody 벤치마크에서 최고의 복합 점수를 기록할 수 있다.
- 고수준 인터페이스(정책 감시, VLA 프레임워크)는 저수준 인터페이스보다 일관되게 우수하다. 인간형 및 4족 보디에서 모든 모델이 직접 토크 제어에 실패했으며, 프로그래밍 기반 또는 정책 기반 제어가 측정 가능한 성공을 가져왔다.
세대 간 개선은 불균형하다
- 고수준 성능 향상은 명확하다. Claude Opus 4.5 → Opus 4.7 및 Mythos Preview에서는 고수준 이동 복합 점수에서 크게 향상(최대 +15점).
- 저수준 제어는 소폭만 개선된다. 직접 제어 점수는 세대 간에 약간 상승하지만, 많은 최신 모델(예: Opus 4.6)은 쓰러진 자세에서 4족 로봇을 일으키는 데 실패한다.
- 강화 학습 감시는 코드 제어보다 뒤처진다. 오직 GPT-5.4만 혼란스러운 TwinFlipper 작업에 대해 능력 있는 정책을 학습할 수 있었으며, 다른 모델들은 단순히 Python 컨트롤러를 작성하는 것보다 성능이 낮았다.
이동 성능 결과
| 로봇 | 작업 | 최고 성능을 보인 Claude 모델 | 인터페이스 |
|---|---|---|---|
| Unitree Go2 (4족) | 균형 유지 (≈2초) | Opus 4.6 / Mythos Preview | 프로그래밍 (Python) |
| Unitree Go2 | 전진 걷기 | Opus 4.6 (프로그래밍) | — |
| Unitree G1 (인간형) | 쓰러진 자세에서 일어나기 | 없음 (모델 모두 실패) | 직접 / 프로그래밍 |
- 고수준 탐색(11개 작업, 예: find_x, maze, drift_detection)은 사전 훈련된 조이스틱 정책과 자침 도구를 사용해 Mythos Preview에서 복합 점수 54/100에 도달했다.
- 지각 보조 도구: 자침은 모든 모델에서 성능을 일관되게 향상시켰으며, 3인칭 카메라는 가장 강력한 모델들(예: Opus 4.7, Mythos Preview)에게만 도움이 되었다.
조작 성능 결과
| 플랫폼 | 작업 | 최고 성능을 보인 Claude 모델 | 성공률 |
|---|---|---|---|
| Franka Panda 팔 (LIBERO) | 직접 엔드 에펙터 제어 | Mythos Preview | 전체 작업 성공률 5.5% |
| 동일 플랫폼 | VLA 감시 조작 (40개 작업 LIBERO) | Opus 4.6 / Opus 4.5 | 약 30% 작업 성공률 (VLA 자체는 70%) |
- 직접 제어: 모델들은 점점 목표 물체에 도달하고 접촉하는 데 성공하지만, 완전한 그립은 여전히 드물다(0–5%).
- VLA 감시: VLA 행동을 수락, 편집, 또는 교체할 수 있을 때 모든 모델이 성능이 향상된다. Claude 모델은 GPT-5.4나 Gemini 3.1보다 VLA 제안을 더 자주 따르며, '제어 손실'을 줄였다.
- 새로운 작업: Opus 4.5–4.7은 VLA 실패를 인식하고 덜 맹목적으로 따르며, 이전 모델보다 더 높은 순수 성과 향상을 달성했다.
시각 및 도구 제거 실험
- 심도 맵, 세그멘테이션, 크로스헤어는 조작에 거의 도움이 되지 않으며, 커서 도구(인터랙티브 포인트 쿼리)는 Mythos Preview의 성공률을 10개 작업 하위 집합에서 6%에서 32%로 끌어올렸다.
- 자침은 이동에 가장 효과적인 보조 도구로, 모든 구성에서 5–12점 향상시켰다.
- 원시 이미지 vs. 텍스트 장면 설명: 오래된 Claude 모델은 텍스트 설명에서 더 잘 수행되며, 픽셀 수준의 공간 인식 능력이 약하다는 것을 시사한다. 최신 Claude 모델(Opus 4.6, Opus 4.7)과 Gemini는 이미지를 텍스트로 대체할 때 성능이 떨어지며, 이미지에서 유용한 시각 정보를 이미 추출하고 있음을 보여준다.
추론 예산 효과
- 대부분의 Claude 세대에서 고전적 제어, 이동, 조작에 미치는 영향은 미미하다.
- 예외: Mythos Preview는 적응형 최대 추론 예산에서 눈에 띄는 성과 향상을 보였으며, GPT-5.4는 이동에서 이점을 얻었고, Gemini 3.1은 혼합된 효과를 보였다.
- 전반적으로: 추가 추론만으로 저수준과 고수준 제어 간 격차를 메울 수 없다.
단기적 인-컨텍스트 학습
- 고전적 제어: 후속 Claude 모델은 초기 성능이 뛰어나기보다는 실패한 시도를 반복함으로써 개선된다.
- 컨텍스트 자르기: 초기 단계를 제거해도 성능에 큰 영향을 주지 않으며, 때로는 오히려 도움이 된다(“컨텍스트 로트”). Mythos Preview는 여전히 강건하여 내장된 전략을 갖추고 있음을 시사한다.
- 고수준 이동 연습: Mythos Preview는 단일 예시 후 간단한 L자형 코스를 학습할 수 있지만, Opus 모델은 여러 반복이 필요하다.
실제 물리적 Unitree Go2에서의 검증
- Find-X 작업: 모델들은 요구되는 1m 이내 접근에 자주 실패하며, 오래된 모델은 잘못된 방향으로 정렬하거나 반사 이미지를 목표로 오해한다.
- 오피스 루프 탐색: 모든 모델이 시각-기억 오류(턴 신호 누락, 복도 과도 진입)로 실패한다.
- 도구 사용: 크로스헤어는 정렬을 판단하는 데 도움이 되지만, 장애물에 대해 오해를 일으킬 수 있다(예: 크로스헤어 왼쪽에 나타난 쓰레기통에 걸려 들어감).
안전성 함의
- 능력의 급격한 변화: 작은 도구 변경(예: 자침 추가)이 모델의 물리적 영향력을 수배 이상으로 증가시킬 수 있다.
- 평가에는 접근 수준 포함 필요: 모델이 능력 있는 컨트롤러와 결합되어 있을 때, 고립된 LLM만 테스트하는 벤치마크는 실제 세계에서의 능력을 과소평가한다.
- 감시 vs. 자율성: 현재 최고의 접근 방식은 언어 모델이 사전 훈련된 정책을 감시하게 하는 것이며, 이를 대체하는 것이 아니라, 이로 인해 위험한 저수준 동작을 제한하면서도 유용한 안내를 제공한다.
연구자 및 실무자에게 주는 통찰
- 로봇에 LLM을 배포할 때 고수준 인터페이스를 우선시하라; 직접 토크 제어는 여전히 신뢰할 수 없다.
- 방향성 도구(자침, 커서)를 제공하여 지각적 한계를 완화하라.
- 지각 및 단기 적응 능력에서 빠른 세대 간 성과 향상을 기대하라지만, 장기적 계획 능력이 도달했다고 가정하지 마라.
- 정책 감시에 안전 장치를 설계하라—LLM이 동작을 거부하거나 조정할 수 있도록 하되, 저수준 컨트롤러를 최종 결정자로 유지하라.
- 전체 스택(LLM + 정책 + 도구)을 사용해 벤치마크를 수행하여 현실적인 능력 추정을 하라.
모든 그림, 표 및 정량적 점수는 Anthropic의 원본 게시물 “How Claude Performs on Robotics Tasks”(2026-07-09)에서 재현되었습니다. 추가 데이터는 생성되지 않았습니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch