GPT-6 Astra 로봇 팔 벤치마크: 블록 놓기 작업에서 95% 성공, Claude Fable 5.1의 40% 대비

하드웨어 성능 요약

GPT-6 Astra는 20회의 시험 중 19회(95% 성공률)에서 '블록을 그릇에 넣는' 작업을 완료했으며, 실행당 $0.94의 비용과 평균 2.5분의 시간을 소요해 Claude Fable 5.1(8/20, $2.12, 6.8분)과 Claude Fable 5(1/20, $2.69, 8.2분)를 압도했습니다. 더 복잡한 '퍼즐을 홈에 맞추는' 작업에서는 Astra와 Fable 5.1 모두 2/20의 성공률을 기록하며, 최종 삽입 단계에서 멈춰버렸습니다.


그릇 작업의 중요성

  • 그릇 작업은 기본적인 집기-옮기기 능력을 격리하여 평가합니다: 집기, 들어올리기, 운반, 놓기.
  • Astra의 평균 단계 점수는 3.95(4점 만점)로, 최종 배치 단계까지 일관되게 도달했지만, Fable 5.1은 평균 2.40, Fable 5는 1.30에 그쳤습니다.
  • 토큰 사용량이 급격히 감소했습니다: Astra는 실행당 약 2천 개의 출력 토큰을 사용한 반면, Fable 5는 약 13천 개를 사용했으며, 이는 추론 비용 절감으로 이어졌습니다.

퍼즐-홈 작업이 드러낸 한계

  • 퍼즐 작업은 둥근 조각을 원형 홈에 정밀하게 정렬하는 것을 요구하며, 세밀한 공간 인식 능력을 시험합니다.
  • Astra와 Fable 5.1은 각각 평균 단계 2.002.35를 기록했으며, 홈에 접근은 가능했지만 삽입을 완료하지 못했습니다.
  • Astra의 실행당 비용($1.36)은 Fable 5.1($2.18)보다 낮았지만, 성공률은 동일하게 10%였습니다.

실험 설정

  • 하드웨어: 양손 I2RT YAM 팔(각각 6-DoF), 평행 쐐기 그립퍼, 3대의 카메라(상단, 왼쪽 손목, 오른쪽 손목) 및 프로피세션을 통한 관찰.
  • 제어: 로봇의 IK 솔버에 입력되는 절대적 종단 효과기 자세(move_to).
  • 정책: Inspect-Robots 허브(v0.58.0)의 agent 정책, 중간 수준의 추론 노력, 20개의 LLM 호출 예산, 25%의 속도 제한.
  • 시행: 모델당 작업별 20회 시험; Astra의 그릇 작업은 rig-1에서, Fable 모델은 rig-3에서 수행; 퍼즐 작업은 모든 모델이 rig-4에서 수행.
  • 평가: 인간 평가자가 각 시험에 대해 단계(0–4)를 부여; 평가 기준은 이전 Fable 보고서와 일치합니다.

비용 및 지연 시간 분석

모델 작업 평균 출력 토큰 수 예상 $/실행 평균 시간(분)
GPT-6 Astra 그릇 2.1k $0.94 2.5
Claude Fable 5.1 그릇 12.9k $2.12 6.8
Claude Fable 5 그릇 19.2k $2.69 8.2
GPT-6 Astra 퍼즐 2.7k $1.36 3.4
Claude Fable 5.1 퍼즐 10.5k $2.18 5.9
Claude Fable 5 퍼즐 16.3k $2.63 7.9
  • 비용은 목록 가격($10/M 입력 토큰, $50/M 출력 토큰) 기준으로 계산되었으며, OpenAI의 자동 입력 캐싱은 고려되지 않았습니다. 이는 Astra의 실제 비용을 더 낮출 수 있습니다.

Hacker News 커뮤니티의 통찰

@baron816 – 공공선을 위한 로봇(예: 보도 쓰레기 수거)에 초점을 맞추어 가치를 입증하고 신뢰를 쌓는 초기 시장으로 삼을 것을 제안합니다.

@gizmodo59 – Astra의 속도와 컴퓨터 사용 작업에서의 유연성에 찬사를 보냈으며, $200 구독료가 가치 있다고 평가했습니다.

@scronkfinkle – LLM이 일상적인 일(예: 세탁)을 처리할 수 있는 시점이 언제인지 묻으며, 인상적인 데모와 실용적인 가정 자동화 사이의 격차를 지적했습니다.

@yurimo – 실험의 범위가 제한적이라고 비판하며, 외부 IK 컨트롤러에 의존하고, 엔드투엔드 VLA/WAM 아키텍처와의 비교가 부족하다고 지적했습니다.

@SillyUsername – 소규모 오픈소스 로봇 팔에서 Astra를 사용한 부정적인 경험을 공유했으며, 높은 비용과 낮은 코드 생성 능력을 지적했습니다.

@sheeshkebab – 결과를 "1세대 아기 수준의 블록 이동을 반복적으로 수행하는 것"으로 요약하며, 소박하지만 실질적인 진전을 강조했습니다.


고려해야 할 한계

  • 시간적 분리 – Astra의 시험은 Fable 시험 2일 후에 이루어졌으며, 환경 변화가 성능에 영향을 줄 수 있습니다.
  • 기기 불일치 – Astra의 그릇 작업은 Fable 시험과 다른 물리적 기기에서 수행되었으며, 성공률에 영향을 줄 수 있습니다.
  • 인간 평가 편향 – 평가자는 각 시험의 모델을 알고 있었기 때문에 무의식적 편향이 발생할 수 있습니다.
  • 비용 과대평가 – 목록 가격 기준의 토큰 비용을 사용했으며, OpenAI의 캐싱은 Astra의 실제 비용을 낮출 수 있지만, Anthropic 시험은 캐싱 혜택을 받지 못했습니다.
  • 수동 재설정 – 시험 간에 물체가 수동으로 재배치되어 변동성이 발생했습니다.
  • 추론 노력 수준 – 모든 모델이 중간 수준의 노력으로 작동했으며, 더 높은 수준의 설정은 결과를 바꿀 수 있습니다.

LLM 기반 로봇 기술에 대한 통찰

  • 효율성 향상 – Astra의 토큰 효율적인 프롬프팅과 빠른 추론은 단순 조작 작업에서 실행당 비용을 크게 낮춥니다.
  • 작업 특이성 – 단순한 집기-옮기기 작업에서는 성공률이 급상승하지만, 정밀한 정렬이 필요한 작업에서는 성공률이 정체되며, 현재 LLM 계획기의 정밀도 부족을 보여줍니다.
  • 확장성 문제 – 단순한 집기-옮기기 작업에 $1~$2의 비용이라도 대규모 배포에는 여전히 높은 수준입니다. 경제적으로 타당한 수준에 도달하려면 하드웨어 발전이나 모델 최적화가 필요합니다.
  • 모듈러 패이프라인 – 고수준 계획(LLM)과 저수준 제어(IK)를 분리하는 것이 가치 있음을 보여주지만, 향후 VLM-에서 VLA 아키텍처로의 통합을 통해 더 큰 성과를 기대할 수 있습니다.

실무자들을 위한 결론

  • 속도와 비용이 중요한 저복잡도 집기-옮기기 작업에는 GPT-6 Astra를 도입하되, 정밀한 삽입 작업은 추가 제어 계층 없이 기대하지 마십시오.
  • 공공 서비스 시범 프로젝트(예: 쓰레기 수거)를 고려하여 능력을 입증하고 현실 세계 데이터를 수집하십시오.
  • 모델 가격 개선과 캐싱의 투명성 향상으로 인해 비용 감소를 예상하십시오.
  • 단순한 집기 작업을 넘어서는 작업을 위해 LLM 계획기와 특화된 저수준 컨트롤러를 결합한 모듈러 로봇 스택을 주목하십시오.

Sources

관련