GPT-6 Astra 로봇 팔 벤치마크: 블록 놓기 작업에서 95% 성공, Claude Fable 5.1의 40% 대비
하드웨어 성능 요약
GPT-6 Astra는 20회의 시험 중 19회(95% 성공률)에서 '블록을 그릇에 넣는' 작업을 완료했으며, 실행당 $0.94의 비용과 평균 2.5분의 시간을 소요해 Claude Fable 5.1(8/20, $2.12, 6.8분)과 Claude Fable 5(1/20, $2.69, 8.2분)를 압도했습니다. 더 복잡한 '퍼즐을 홈에 맞추는' 작업에서는 Astra와 Fable 5.1 모두 2/20의 성공률을 기록하며, 최종 삽입 단계에서 멈춰버렸습니다.
그릇 작업의 중요성
- 그릇 작업은 기본적인 집기-옮기기 능력을 격리하여 평가합니다: 집기, 들어올리기, 운반, 놓기.
- Astra의 평균 단계 점수는 3.95(4점 만점)로, 최종 배치 단계까지 일관되게 도달했지만, Fable 5.1은 평균 2.40, Fable 5는 1.30에 그쳤습니다.
- 토큰 사용량이 급격히 감소했습니다: Astra는 실행당 약 2천 개의 출력 토큰을 사용한 반면, Fable 5는 약 13천 개를 사용했으며, 이는 추론 비용 절감으로 이어졌습니다.
퍼즐-홈 작업이 드러낸 한계
- 퍼즐 작업은 둥근 조각을 원형 홈에 정밀하게 정렬하는 것을 요구하며, 세밀한 공간 인식 능력을 시험합니다.
- Astra와 Fable 5.1은 각각 평균 단계 2.00과 2.35를 기록했으며, 홈에 접근은 가능했지만 삽입을 완료하지 못했습니다.
- Astra의 실행당 비용($1.36)은 Fable 5.1($2.18)보다 낮았지만, 성공률은 동일하게 10%였습니다.
실험 설정
- 하드웨어: 양손 I2RT YAM 팔(각각 6-DoF), 평행 쐐기 그립퍼, 3대의 카메라(상단, 왼쪽 손목, 오른쪽 손목) 및 프로피세션을 통한 관찰.
- 제어: 로봇의 IK 솔버에 입력되는 절대적 종단 효과기 자세(
move_to). - 정책: Inspect-Robots 허브(v0.58.0)의
agent정책, 중간 수준의 추론 노력, 20개의 LLM 호출 예산, 25%의 속도 제한. - 시행: 모델당 작업별 20회 시험; Astra의 그릇 작업은 rig-1에서, Fable 모델은 rig-3에서 수행; 퍼즐 작업은 모든 모델이 rig-4에서 수행.
- 평가: 인간 평가자가 각 시험에 대해 단계(0–4)를 부여; 평가 기준은 이전 Fable 보고서와 일치합니다.
비용 및 지연 시간 분석
| 모델 | 작업 | 평균 출력 토큰 수 | 예상 $/실행 | 평균 시간(분) |
|---|---|---|---|---|
| GPT-6 Astra | 그릇 | 2.1k | $0.94 | 2.5 |
| Claude Fable 5.1 | 그릇 | 12.9k | $2.12 | 6.8 |
| Claude Fable 5 | 그릇 | 19.2k | $2.69 | 8.2 |
| GPT-6 Astra | 퍼즐 | 2.7k | $1.36 | 3.4 |
| Claude Fable 5.1 | 퍼즐 | 10.5k | $2.18 | 5.9 |
| Claude Fable 5 | 퍼즐 | 16.3k | $2.63 | 7.9 |
- 비용은 목록 가격($10/M 입력 토큰, $50/M 출력 토큰) 기준으로 계산되었으며, OpenAI의 자동 입력 캐싱은 고려되지 않았습니다. 이는 Astra의 실제 비용을 더 낮출 수 있습니다.
Hacker News 커뮤니티의 통찰
@baron816 – 공공선을 위한 로봇(예: 보도 쓰레기 수거)에 초점을 맞추어 가치를 입증하고 신뢰를 쌓는 초기 시장으로 삼을 것을 제안합니다.
@gizmodo59 – Astra의 속도와 컴퓨터 사용 작업에서의 유연성에 찬사를 보냈으며, $200 구독료가 가치 있다고 평가했습니다.
@scronkfinkle – LLM이 일상적인 일(예: 세탁)을 처리할 수 있는 시점이 언제인지 묻으며, 인상적인 데모와 실용적인 가정 자동화 사이의 격차를 지적했습니다.
@yurimo – 실험의 범위가 제한적이라고 비판하며, 외부 IK 컨트롤러에 의존하고, 엔드투엔드 VLA/WAM 아키텍처와의 비교가 부족하다고 지적했습니다.
@SillyUsername – 소규모 오픈소스 로봇 팔에서 Astra를 사용한 부정적인 경험을 공유했으며, 높은 비용과 낮은 코드 생성 능력을 지적했습니다.
@sheeshkebab – 결과를 "1세대 아기 수준의 블록 이동을 반복적으로 수행하는 것"으로 요약하며, 소박하지만 실질적인 진전을 강조했습니다.
고려해야 할 한계
- 시간적 분리 – Astra의 시험은 Fable 시험 2일 후에 이루어졌으며, 환경 변화가 성능에 영향을 줄 수 있습니다.
- 기기 불일치 – Astra의 그릇 작업은 Fable 시험과 다른 물리적 기기에서 수행되었으며, 성공률에 영향을 줄 수 있습니다.
- 인간 평가 편향 – 평가자는 각 시험의 모델을 알고 있었기 때문에 무의식적 편향이 발생할 수 있습니다.
- 비용 과대평가 – 목록 가격 기준의 토큰 비용을 사용했으며, OpenAI의 캐싱은 Astra의 실제 비용을 낮출 수 있지만, Anthropic 시험은 캐싱 혜택을 받지 못했습니다.
- 수동 재설정 – 시험 간에 물체가 수동으로 재배치되어 변동성이 발생했습니다.
- 추론 노력 수준 – 모든 모델이 중간 수준의 노력으로 작동했으며, 더 높은 수준의 설정은 결과를 바꿀 수 있습니다.
LLM 기반 로봇 기술에 대한 통찰
- 효율성 향상 – Astra의 토큰 효율적인 프롬프팅과 빠른 추론은 단순 조작 작업에서 실행당 비용을 크게 낮춥니다.
- 작업 특이성 – 단순한 집기-옮기기 작업에서는 성공률이 급상승하지만, 정밀한 정렬이 필요한 작업에서는 성공률이 정체되며, 현재 LLM 계획기의 정밀도 부족을 보여줍니다.
- 확장성 문제 – 단순한 집기-옮기기 작업에 $1~$2의 비용이라도 대규모 배포에는 여전히 높은 수준입니다. 경제적으로 타당한 수준에 도달하려면 하드웨어 발전이나 모델 최적화가 필요합니다.
- 모듈러 패이프라인 – 고수준 계획(LLM)과 저수준 제어(IK)를 분리하는 것이 가치 있음을 보여주지만, 향후 VLM-에서 VLA 아키텍처로의 통합을 통해 더 큰 성과를 기대할 수 있습니다.
실무자들을 위한 결론
- 속도와 비용이 중요한 저복잡도 집기-옮기기 작업에는 GPT-6 Astra를 도입하되, 정밀한 삽입 작업은 추가 제어 계층 없이 기대하지 마십시오.
- 공공 서비스 시범 프로젝트(예: 쓰레기 수거)를 고려하여 능력을 입증하고 현실 세계 데이터를 수집하십시오.
- 모델 가격 개선과 캐싱의 투명성 향상으로 인해 비용 감소를 예상하십시오.
- 단순한 집기 작업을 넘어서는 작업을 위해 LLM 계획기와 특화된 저수준 컨트롤러를 결합한 모듈러 로봇 스택을 주목하십시오.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch