Project Fetch: Evaluating Claude's Impact on Robotics Task Performance

TL;DR

Anthropic는 비전문가가 4족 보행 로봇을 프로그래밍하여 비치볼을 회수하도록 도울 수 있는지 확인하기 위해 성능 향상 연구인 "Project Fetch"를 수행했습니다. 결과에 따르면 AI를 활용한 팀은 AI를 사용하지 않는 팀보다 작업을 훨씬 더 빠르게 완료하고 완전한 자율성에 더 큰 진전을 이루었습니다.

Experiment Design and Methodology

Anthropic 연구원들은 8명의 비로봇 공학 전문가를 두 그룹으로 나누었습니다: "Team Claude" (AI 액세스 가능) 및 "Team Claude-less" (AI 액세스 불가).

팀들에게는 점진적으로 난이도가 높아지는 세 단계의 로봇 개 운영 단계가 과제로 주어졌습니다:

  • Phase One: 제조업체에서 제공한 컨트롤러를 사용하여 공을 특정 구역으로 가져오는 것.
  • Phase Two: 로봇에 컴퓨터 연결을 설정하고, 온보드 센서(video 및 lidar)에 액세스하며, 회수를 위한 맞춤형 소프트웨어 프로그램을 개발하는 것.
  • Phase Three: 로봇이 공을 자율적으로 감지하고 가져오도록 하는 프로그램을 개발하는 것.

Key Findings: AI Uplift in Robotics

Performance and Speed

Team Claude는 작업 완료 및 효율성 면에서 명확한 우위를 보여주었습니다. 두 팀 모두 완료한 작업에 대해, Team Claude는 Team Claude-less가 소요한 시간의 약 절반 정도만 소요했습니다. Team Claude-less가 8개 작업 중 6개를 완료한 반면, Team Claude는 7개 작업을 완료했습니다.

Technical Advantages

Claude는 하드웨어 상호작용의 초기 단계에서 가장 큰 성능 향상을 제공했습니다:

  • Connectivity: Team Claude는 연결 방법을 탐색하는 데 더 효율적이었으며 잘못된 온라인 문서로 인해 잘못된 방향으로 유도되는 것을 피했습니다. 반면, Team Claude-less는 가장 쉬운 연결 방법을 조기에 폐기했습니다.
  • Sensor Integration: Team Claude는 lidar 센서의 데이터에 더 쉽게 액세스할 수 있었던 반면, Team Claude-less는 하루가 끝날 때까지 이 작업에 어려움을 겪었습니다.
  • Program Quality: Team Claude가 제어 프로그램을 작성하는 데 더 오랜 시간이 걸렸지만, 결과물인 소프트웨어는 더 우수했습니다. Team Claude-less가 사용한 간헐적인 스틸 이미지 대신 스트리밍 비디오 피드를 제공했습니다.

Trade-offs and "Side Quests"

실험 결과 AI 지원이 서로 다른 워크플로우를 유발할 수 있음이 드러났습니다. Team Claude는 Team Claude-less보다 약 9배 더 많은 코드를 작성했습니다. 이는 그들이 여러 접근 방식을 병렬적으로 탐색할 수 있게 해주었지만, 동시에 주요 목표로부터의 "side quests"와 주의 분산도 유발했습니다. 예를 들어, 한 팀원은 로봇을 위한 자연어 컨트롤러를 개발했는데, 이는 주요 작업에 요구되지 않았습니다.

Impact on Team Dynamics and Morale

Emotional Expression and Confusion

오디오 트랜스크립트의 정량적 분석 결과, Team Claude-less가 Team Claude보다 두 배 높은 비율로 혼란을 표현했습니다. 그들의 대화는 일반적으로 더 부정적이었으며, 평소 사용하는 AI 도구에 대한 액세스 없이 코딩 기술이 저하된 것 같다고 보고했습니다.

Collaboration Styles

두 팀은 뚜렷한 작업 패턴을 것을 보여주었습니다:

  • Team Claude: 팀원들은 주로 개별 AI 어시스턴트와 파트너십을 맺고 목표를 향해 병렬적인 경로를를 따라갔습니다.
  • Team Claude-less: 팀원들은 서로 더 깊게 전략을 짜고 AI를 활용한 팀보다 44% 더 많은 질문을 했습니다.

Limitations and Future Implications

Study Limitations

Anthropic은 작은 샘플 크기(두 팀), 짧은 기간(하루), 그리고 이미 AI에 익숙한 Anthropic 직원이라는 편의 샘플을 사용했다는 점을 포함하여 연구의 몇 가지 제약 사항을 언급했습니다.

The Path to Autonomy

Anthropic은 "uplift often precedes autonomy" (성능 향상은 종종 자율성으로 이어진다)라고 주장하며, 오늘날 로봇 공학에서 인간을 돕는 AI의 능력이 미래에 AI가 이러한 작업을 독립적으로 수행할 수 있게 되는 전조라고 제안합니다. 이 능력은 Anthropic의 Responsible Scaling Policy에서 중요한 임계값으로 강조됩니다. 하드웨어를 포함한 자율적인 AI R&D는 AI 능력의 급격하고 예측 불가능한 advances in AI capabilities에 이끌릴 수 있기 때문입니다.

Sources

관련