GrabMaps를 위한 Grab의 GPT-4o Vision Fine-Tuning

Grab은 GPT-4o vision fine-tuning을 활용하여 거리 수준의 이미지에서 지도 데이터를 추출하는 과정을 자동화했으며, 이를 통해 동남아시아 지역의 교통 표지판 위치 식별 및 차선 수 계산의 정확도를 크게 향상시켰습니다. 이러한 구현은 수동 지도 제작 노력과 운영 비용을 절감하는 동시에, Grab의 월간 사용자 4,200만 명과 기업 고객을 위한 데이터 신뢰성을 개선합니다.

Vision Fine-Tuning을 통한 지도 제작 자동화

GrabMaps는 GPT-4o vision fine-tuning을 활용하여 오토바이 및 보행자 파트너 차량의 360도 카메라를 통해 수집된 수백만 개의 거리 수준 이미지를 실행 가능한 지도 데이터로 변환합니다. 이 모델은 이전 방식보다 속도 제한 표지판, 회전 제한, 장소 및 도로 기하학적 구조를 더 정확하게 식별하는 데 사용됩니다.

모델을 최적화하기 위해 Grab은 속도 제한 표지판을 해당 도로와 매칭하는 데 중점을 둔 실험을 수행했습니다. 프로세스는 다음과 같습니다:

  • Dataset: 거리 수준 이미지와 map tiles를 결합한 100개의 샘플 케이스를 사용한 fine-tuning.
  • Iteration: 두 차례의 fine-tuning을 통한 하이퍼파라미터 조정.
  • Performance Gain: 기준 정확도가 67%에서 80%로 증가하여 13%포인트 향상됨.

기술적 역량 및 복잡한 시나리오 처리

GPT-4o의 vision 역량 덕분에 GrabMaps는 거리 이미지와 map tiles를 교차 참조하여 문맥을 인식하는 결정을 내릴 수 있습니다. 이 접근 방식은 이전에 수동 개입이 필요했던 복잡한 기하학적 구조를 효과적으로 처리합니다:

  • 고가 도로 (Elevated Roads): 모델이 서로 다른 도로 레벨을 구분할 수 있습니다.
  • 폐쇄 (Occlusions): 표지판이나 도로 특징이 부분적으로 가려진 경우에도 모델이 정확도를 유지합니다.

Grab의 Geo Mapping 데이터 과학 책임자인 Adrian Margin은 "우리 데이터를 사용하여 GPT-4o를 fine-tuning함으로써 복잡한 기하학적 구조를 효과적으로 처리할 수 있었고, 수동 개입과 운영 비용을 줄일 수 있었습니다"라고 밝혔습니다.

지도 정확도에 미치는 정량적 영향

vision fine-tuning의 통합은 데이터 품질과 운영 효율성 측면에서 측정 가능한 개선을 가져왔습니다:

  • 차선 수 정확도: 20% 증가.
  • 속도 제한 표지판 위치 식별: 13% 향상.
  • 운영 비용: 수동 지도 제작 노력의 감소를 통해 절감.
  • 데이터 신뢰도: 지도 출력의 높은 정확도는 내부 운영 및 기업 고객을 위한 데이터 품질에 대한 신뢰 증가로 이어집니다.

Grab의 향후 AI 이니셔티브

지도 제작 외에도 Grab은 접근성과 사용자 지원을 개선하기 위해 AI 통합을 확장하고 있습니다:

  • 대화형 음성 비서: 시각 장애인 및 노인 사용자의 앱 탐색을 돕기 위해 현재 개발 중인 다국어 도구.
  • 고급 지원 챗봇: 상세한 표준 운영 절차(SOPs)를 처리하여 공감 능력이 있고 맞춤화된 응답을 제공하도록 설계된 시스템.

Sources