Grab GPT-4o 视觉微调 用于 GrabMaps
Grab 使用 GPT-4o 视觉微调 自动提取街景图像中的地图数据,显著提高了东南亚地区交通标志定位和车道计数的准确性。此实施减少了手动制图工作和运营成本,同时提升了 Grab 4200万月活用户和企业客户的数据可靠性。
使用视觉微调自动化制图
GrabMaps 利用 GPT-4o 视觉微调 将数百万张街景图像——通过摩托车和步行伙伴车辆上的 360 度摄像头采集——转化为可操作的地图数据。该模型用于比以前方法更准确地定位限速标志、转弯限制、地点和道路几何形状。
为了优化模型,Grab 进行了以匹配限速标志与对应道路为重点的实验。过程包括:
- 数据集:使用 100 个结合街景图像和地图瓦片的样本案例进行微调。
- 迭代:在两轮微调过程中调整超参数。
- 性能提升:基准准确率从 67% 提升至 80%,提升了 13 个百分点。
技术能力和复杂场景处理
GPT-4o 的视觉能力使 GrabMaps 能够通过将街景图像与地图瓦片进行交叉引用来做出感知上下文的决策。此方法能够有效处理以前需要人工干预的复杂几何形状,具体如下:
- 高架道路:模型能够区分不同的道路层级。
- 遮挡:即使标志或道路特征部分被遮挡,模型仍能保持准确性。
根据 Grab 地图数据科学负责人 Adrian Margin 的说法:“用我们的数据对 GPT-4o 进行微调使我们能够有效处理复杂几何形状,减少人工干预和运营成本。”
制图准确性的可量化影响
视觉微调的集成带来了数据质量和运营效率的可衡量提升:
- 车道计数准确性:提高了 20%。
- 限速标志定位:提高了 13%。
- 运营成本:通过减少手动制图工作来降低。
- 数据可信度:地图输出的更高准确性提升了内部运营和企业客户对数据质量的信任。
Grab 的未来 AI 倡议
除了制图之外,Grab 正在扩展其 AI 集成以提高可访问性和用户支持:
- 对话式语音助手:一种目前正在开发的多语言工具,用于帮助视力受损和老年用户导航应用。
- 高级支持聊天机器人:一个通过处理详细的标准操作程序(SOP)来处理复杂查询的系统,以提供富有同理心且量身定制的响应。