Grab GPT-4o 視覺微調用於 GrabMaps

Grab 已利用 GPT-4o 視覺微調自動化從街景圖像中提取映射資料,顯著提升了東南亞交通標誌定位和車道計數的準確度。此實施減少了手動映射工作和運營成本,同時提升了 Grab 4200萬月活用戶和企業客戶的數據可靠性。

使用視覺微調自動化製圖

GrabMaps 利用 GPT-4o 視覺微調將數百萬張街景圖像—透過機車和步行夥伴車輛上的 360 度相機收集—轉化為可操作的映射資料。該模型用於比以前方法更準確地定位速限標誌、轉彎限制、地點和道路幾何。

為了優化模型,Grab 進行了專注於將速限標誌與其對應道路匹配的實驗。該過程包括:

  • 資料集:使用 100 個結合街景圖像和地圖瓦片的樣本案例進行微調。
  • 迭代:在兩輪微調過程中調整超參數。
  • 效能提升:基準準確度從 67% 提升至 80%,代表提升 13 個百分點。

技術能力與複雜情境處理

GPT-4o 的視覺能力使 GrabMaps 能透過將街景圖像與地圖瓦片交叉參考來做出情境感知的決策。此方法能有效處理過去需要人工手動干預的複雜幾何,具體如下:

  • 高架道路:模型能區分不同的道路層級。
  • 遮擋:即使標誌或道路特徵被部分遮擋,模型仍能保持準確度。

根據 Grab 地圖資料科學主管 Adrian Margin 的說法:「使用我們的資料對 GPT-4o 進行微調,使我們能有效處理複雜幾何,減少人工干預和運營成本。」

對映射準確度的可量化影響

視覺微調的整合帶來了資料品質和運營效率的可量化提升:

  • 車道計數準確度:提升 20%。
  • 速限標誌定位:提升 13%。
  • 運營成本:透過減少手動映射工作來降低。
  • 數據可信度:映射輸出的更高準確度提升了內部運營和企業客戶對數據品質的信任。

Grab 的未來 AI 倡議

除了製圖,Grab 正擴展其 AI 整合以提升可存取性和用戶支援:

  • 對話語音助理:一種目前正在開發的多語言工具,用於協助視障和長者用戶導航應用程式。
  • 進階支援聊天機器人:一個透過處理詳細標準作業程序(SOP)來應對複雜詢問的系統,以提供富有同理心且量身定制的回應。

Sources