DrivingBench는 GPT-6 Astra가 실제 Toyota Corolla를 조종하여 콘 코스를 주행할 수 있음을 보여줍니다

GPT-6 Astra가 실제 자동차를 운전하다 – 이 벤치마크가 증명하는 것과 그렇지 않은 것

핵심 요약: GPT-6 Astra는 Toyota Corolla의 조향, 가속 및 제동 장치에 연결되어 사전 정의된 콘 코스 벤치마크를 성공적으로 완료했습니다. 이는 최첨단 규모의 LLM이 통제된 환경에서 저수준의 차량 명령을 내릴 수 있음을 증명합니다. 이 결과는 놀라운 개념 증명(proof-of-concept)이지만, 지연 시간, 실제 환경의 역학, 그리고 안전성 문제로 인해 현재의 자율 주행 생산 환경에는 이 접근 방식이 실용적이지 않다는 점을 시사합니다.


DrivingBench의 측정 항목

  • 설정: LLM이 CAN-bus 인터페이스를 통해 set_motion(조향, 스로틀, 브레이크) 및 stop_now를 호출할 수 있도록 Toyota Corolla를 계측했습니다.
  • 작업: 중심선 주변 4m 복도 내에 머물면서 고정된 콘 코스를 주행합니다.
  • 측정 지표:
    • 시도 진행률: 충돌 또는 중도 포기(DNF) 전까지 통과한 중심선의 비율.
    • 거리: 첫 번째로 수락된 동작 명령부터 마지막 명령까지의 GPS 통합 거리.
    • 완주 시간: 첫 번째 수락된 명령부터 시도 종료까지 경과된 시간.
    • 명령: set_motion 및 stop_now 호출 횟수.
    • 토큰 · 비용: 사용된 총 LLM 토큰 및 정가 기준의 API 비용.
  • 리더보드: 각 모델은 단일 연속 채팅 세션에서 최대 3회까지 시도할 수 있으며, 실행 결과는 비디오 및 궤적 재생을 통해 개별적으로 검토할 수 있습니다.

"트랙 탐색 – 궤적 재생 보기" – DrivingBench UI (https://drivingbench.com/)

Astra의 성능

  • Astra는 나열된 모델 중 가장 높은 시도 진행률을 달성했으며, 4m 복도를 벗어나지 않고 코스를 완료했습니다.
  • 이 주행에는 X회의 set_motion 호출(정확한 횟수는 리더보드에 표시됨)이 필요했으며, Y개의 토큰을 소비하여 현재 API 요금 기준으로 약 $Z의 비용이 발생했습니다.
  • 비디오 증거에 따르면 차량은 저속으로 콘 라인을 부드럽게 따라가며 충돌 전에 정지하는 모습을 보여줍니다.

참고: 스크랩된 페이지는 지표 설명을 여러 번 반복하므로 소스에서 정확한 수치 값을 확인할 수 없습니다.

커뮤니티 분석: 지연 시간이 가장 큰 걸림돌

클라우드 지연 시간은 실제 환경에서의 실행 가능성을 저해합니다

"클라우드 서비스에 단 한 번의 빛의 속도 RTT(왕복 시간)를 추가하는 것만으로도 치명적입니다… 그때쯤이면 자동차 주변의 세상은 이미 변해 있을 것입니다." – jyoung8607, 전 openpilot 기여자

Open-pilot 업데이트는 20Hz(50ms마다)의 곡률과 가속도를 목표로 합니다. 클라우드 기반 LLM은 수백 밀리초 단위의 왕복 시간을 발생시키며, 이는 동적 교통 상황에서 안전한 작동을 위해 필요한 제어 루프 예산을 훨씬 초과합니다.

하드웨어 인 더 루프(Hardware-in-the-loop)는 여전히 필수입니다

"Tesla와 다른 모든 자율 주행 제조사가 차량 내부에 컴퓨팅 하드웨어를 필요로 하는 데에는 이유가 있습니다." – jyoung8607

LLM이 완벽한 조향 명령을 생성할 수 있다 하더라도, 원시 카메라 프레임을 원격 모델로 전송하고, 추론을 기다린 뒤, 작동 명령을 다시 보내는 지연 시간은 정적이고 저속인 코스 외부에서는 시스템을 사용할 수 없게 만듭니다.

일부 의견에 따르면 지연 시간만이 유일한 장애물입니다

"현재로서는 대부분 지연 시간 문제입니다. 모델이 너무 커서 로컬에서 실행할 수 없지만, Qwen과 같은 오픈 웨이트 모델이 이미 존재한다는 점을 고려하면 Astra와 동등한 오픈 웨이트 저지연 모델이 나오는 것도 머지않았을 것입니다." – valine

커뮤니티는 핵심 기술적 난제가 모델의 능력이 아니라 장치 내 실시간 추론이라는 점에 동의합니다.

토론에서 나온 기타 관찰 사항

  • 시각적 역량: 댓글 작성자들은 Astra가 시각 중심 벤치마크(예: ARC-3, SpatialBench)에서 강력한 성능을 보인 점에 주목하며, 다중 모달 학습이 주행 성공에 기여했을 것이라고 추측합니다.
  • 도구 사용 프레임워크: 일부는 이 벤치마크를 전문화된 인식 파이프라인이 아닌 범용 도구 사용자로서의 LLM을 보여주는 사례로 봅니다.
  • 안전 및 책임: 여러 사용자는 예측 불가능한 행동과 법적 책임을 이유로 공공 도로에 이러한 시스템을 배치하는 것에 대해 경고합니다.
  • 벤치마크의 참신함: 커뮤니티는 이 벤치마크가 흥미롭기는 하지만 실제 자율 주행 스택과의 관련성에 대해서는 의문을 제기합니다.

이 벤치마크가 AI 연구에 중요한 이유

  1. 다중 모달 통합의 증명: Astra는 시각적 입력을 받아들이고 언어로 추론하며 저수준 제어 신호를 방출할 수 있어, 통합된 인식-행동 모델로의 한 걸음을 보여줍니다.
  2. 도구 사용 파이프라인: 이 실험은 자동차를 LLM이 호출할 수 있는 도구로 취급하며, 외부 API를 조정하는 LLM에 대한 최신 연구와 맥을 같이 합니다.
  3. 지표 투명성: DrivingBench는 시도 진행률, 토큰 사용량, 비용을 공개함으로써 향후 모델을 비교할 수 있는 재현 가능한 프레임워크를 제공합니다.

한계 및 미해결 질문

  • 확장성: 이 벤치마크는 단순한 콘 코스에서 저속으로 실행되며, 교통, 보행자 또는 복잡한 도로 기하학과의 상호 작용을 테스트하지 않습니다.
  • 지연 시간 측정: 공개된 데이터에는 종단 간(end-to-end) 지연 시간 수치가 포함되어 있지 않으며, 이를 알 수 없으면 실시간 실행 가능성을 평가할 수 없습니다.
  • 안전 보장: 공식적인 검증이나 안전 장치(fail-safe) 메커니즘이 설명되어 있지 않으며, 시스템은 인간의 감독에 의존합니다.
  • 비용: 정가 토큰 요금 기준으로 1회 실행에 수 달러가 소요되는데, 이는 대규모 테스트에는 부담이 될 수 있습니다.

전망

DrivingBench는 GPT-6 Astra와 같은 최첨단 LLM이 제한된 환경에서 실제 차량을 기술적으로 제어할 수 있음을 보여주며 다중 모달 AI의 이정표를 세웠습니다. 그러나 Hacker News의 중론은 명확합니다. 지연 시간과 안전성은 실제 자율 주행에 클라우드 기반 LLM을 배치하는 데 있어 극복할 수 없는 장벽으로 남아 있습니다. 향후 발전은 비교 가능한 모델 용량을 엣지 하드웨어로 가져오거나, 빠른 인식 스택과 고수준 LLM 추론을 결합한 하이브리드 시스템을 설계하는 방향으로 진행될 가능성이 높습니다.

Sources

관련