Grab GPT-4o ビジョン ファインチューニングのための GrabMaps

Grab は、GPT-4o ビジョン ファインチューニングを活用し、ストリートレベルの画像からマッピングデータの抽出を自動化しました。これにより、東南アジアにおける交通標識の位置特定と車線カウントの精度が大幅に向上しました。この実装により、手動マッピングの作業と運用コストが削減され、Grab の月間 4,200 万人のユーザーおよびエンタープライズ顧客に対するデータの信頼性が向上しています。

ビジョン ファインチューニングによるマップ作成の自動化

GrabMaps は、GPT-4o ビジョン ファインチューニングを活用し、モーターバイクおよび歩行者パートナー車両に搭載された 360 度カメラで収集された何百万枚ものストリートレベル画像を、実用的なマッピングデータに変換します。このモデルは、以前の方法よりも正確に速度制限標識、転回制限、場所、および道路形状を位置特定するために使用されます。

モデルを最適化するため、Grab は速度制限標識と対応する道路をマッチングさせることに焦点を当てた実験を実施しました。プロセスは以下の通りです:

  • Dataset: ストリートレベル画像とマップタイルを組み合わせた 100 のサンプルケースを使用したファインチューニング。
  • Iteration: 2 回のファインチューニングラウンドでハイパーパラメータを調整。
  • Performance Gain: ベースラインの精度が 67% から 80% に向上し、13 パーセンテージポイントの改善を示しました。

テクニカルな能力と複雑なシナリオの処理

GPT-4o のビジョン機能により、ストリート画像とマップタイルを照らし合わせることで、コンテキストを考慮した意思決定が可能になります。このアプローチは、以前は手動での人間の介入が必要だった複雑な形状を効果的に処理します。具体的には:

  • Elevated Roads: モデルは異なる道路レベルを区別できます。
  • Occlusions: 標識や道路の特徴が一部遮られている場合でも、モデルは精度を維持します。

グラブのジオマッピングにおけるデータサイエンス責任者である Adrian Margin 氏は「私たちのデータで GPT-4o をファインチューニングすることで、複雑な形状を効果的に処理し、手動の介入と運用コストを削減することができました。」と述べています。

マッピング精度の定量的影響

ビジョン ファインチューニングの統合により、データ品質と運用効率において測定可能な改善がもたらされました:

  • Lane Count Accuracy: 20% 向上。
  • Speed Limit Sign Localization: 13% 向上。
  • Operational Costs: 手動マッピングの作業減少により削減。
  • Data Trust: マップ出力の精度が向上することで、内部運用およびエンタープライズ顧客におけるデータ品質への信頼が高まります。

Grab の今後の AI イニシアティブ

マッピングを超えて、Grab はアクセシビリティとユーザーサポートの向上のために AI の統合を拡大しています:

  • Conversational Voice Assistant: 視覚に障害のあるユーザーおよび高齢ユーザーがアプリをナビゲートできるよう支援する、現在開発中の多言語ツール。
  • Advanced Support Chatbot: 詳細な標準作業手順 (SOP) を処理して共感的かつカスタマイズされた応答を提供するよう設計された、複雑な問い合わせに対応するシステム。

Sources