OpenAI 宣布为 Be My Eyes 推出基于 GPT‑4 的虚拟志愿者
TL;DR
OpenAI 将 GPT‑4 的视觉输入能力集成到 Be My Eyes 应用中,推出了一个可以描述、分析并就图像进行对话的“虚拟志愿者”,为盲人和低视力用户提供实时、情境丰富的帮助。
公告内容
OpenAI 宣布丹麦初创公司 Be My Eyes 正在将 GPT‑4(研究预览版)嵌入其移动应用,以驱动 Virtual Volunteer™。该助手能够处理用户提交的照片,生成详细描述,回答后续问题,并提供可操作的建议,例如食谱推荐或导航指示。
为什么重要
Virtual Volunteer 提供的视觉解释和交互式对话水平超越了传统的图像转文本工具,承诺为全球约 2.5 亿盲人或低视力人士带来更大的独立性。
技术基础
- GPT‑4 视觉输入:模型除了接受文本外,还接受图像数据,实现多模态推理。
- 对话上下文:不同于静态的对象识别 API,GPT‑4 能保持来回对话,根据用户提示细化答案。
- 分析能力:系统不仅能命名对象,还能推断关系、评估安全隐患,并提供后续建议(例如,“这些面条适合做菜谱吗?”)。
核心功能
图像描述与分析
助手能够识别对象,读取图像中的文字,并提供细致的解释。例如,一张冰箱的照片可以生成物品清单、可能的食谱以及营养信息。
实时导航帮助
用户能够获得穿越火车站的逐步指引,包括地图定位和安全警示,展示了模型解释复杂空间信息的能力。
网页理解
GPT‑4 可以展示整页网页,然后总结最相关的部分,过滤冗余信息,提供简洁答案——帮助用户浏览新闻站点、电子商务页面以及其他视觉密集的内容。
初期测试与反馈
- Beta 推出:2023 年 2 月初,Be My Eyes 开始在少数员工中进行内部 Beta 测试。
- 积极反馈:CEO Michael Buckley 称其表现“无与伦比”,相较于现有的图像转文本工具。Beta 参与者包括无障碍倡导者 Lucy Edwards,对新功能表示热情。
“GPT‑4 与其他语言和机器学习模型的区别在于它既能够进行对话,又提供了更高程度的分析能力。” — Jesper Hvirring Henriksen,CTO,Be My Eyes
对可访问性的影响
- 提升独立性:用户无需等待真人志愿者即可获得即时、详细的视觉信息,扩大了他们能够独立完成的任务范围。
- 更广的应用范围:除了日常物品外,该技术还能帮助阅读屏幕、评估产品安全性,并在杂乱的电子商务网站上做出购买决策。
- 商业潜力:Buckley 强调了该技术在带来社会效益的同时,也为 AI 驱动的可访问性解决方案提供了巨大的市场机会。
下一步
OpenAI 与 Be My Eyes 计划在 Beta 结束后数周内向更广泛的 Be My Eyes 用户群推出 Virtual Volunteer,并根据用户反馈持续改进,同时进行进一步的安全评估。
本文概述了 OpenAI 于 2023 年 3 月 14 日的官方公告。所有陈述均直接取自原始材料。