ChatGPT 语音和图像功能更新

OpenAI 已将语音和图像功能集成到 ChatGPT 中,将界面从纯文本转变为多模态体验。此更新使用户能够进行实时语音对话并提供视觉输入,供模型进行分析和讨论。

语音交互功能

ChatGPT 现在支持双向语音对话,使用户能够免手操作地与助手交互。此功能可通过 iOS 和 Android 上的“New Features”菜单中的选择加入设置获得。

语音技术实现

语音体验由两种主要技术的组合驱动:

  • Text-to-Speech (TTS): 一种新模型,能够从文本和几秒钟的示例语音生成类似人类的音频。可用的声音是通过与专业配音演员合作创建的。
  • Speech Recognition: OpenAI 的开源 Whisper 系统用于将口语转录为文本,以便模型处理。

图像理解和视觉输入

用户现在可以向 ChatGPT 提供一张或多张图像,以执行诸如故障排除硬件、根据食柜内容规划餐食或分析复杂数据图表等任务。在移动设备上,提供了一种绘图工具,以帮助用户将模型的注意力集中在图像的特定部分。

多模态模型架构

图像理解由 GPT-3.5 和 GPT-4 的多模态版本驱动。这些模型将语言推理技能应用于各种视觉格式,包括照片、截屏以及结合文本和图像的文档。

安全和部署策略

OpenAI 将在两周内逐步向 Plus 和 Enterprise 用户部署这些功能,随后计划将访问权限扩展到开发者和其他用户群体。此分阶段推出旨在完善风险缓解措施,并使用户为更强大的系统做好准备。

语音安全和风险缓解

由于创建逼真的合成语音的能力可能被用于冒充或欺诈,OpenAI 将该技术的应用限制在特定用例:使用专业演员创建的语音进行语音聊天。在 ChatGPT 之外,OpenAI 正与 Spotify 等合作伙伴合作,为播客试点语音翻译功能。

视觉安全和隐私

为了解决诸如对人物的幻觉或在高风险领域滥用等风险,OpenAI 实施了以下措施:

  • Red Teaming: 模型由红队成员和 Alpha 测试者进行测试,以检查与科学熟练度和极端主义相关的风险。
  • Privacy Restrictions: 已实施技术措施,以显著限制 ChatGPT 分析和对人物做出直接陈述的能力,以保护隐私并确保准确性。
  • Accessibility Collaboration: 视觉功能的开发参考了与 Be My Eyes 的合作,Be My Eyes 是一款面向盲人和低视力人士的应用。

模型限制

OpenAI 指出了视觉功能的具体限制:

  • Verification Required: 建议用户在未进行适当验证的情况下不要将模型用于高风险用例。
  • Language Constraints: 虽然模型在转录英文文本方面表现熟练,但对其他语言的处理效果较差,尤其是使用非拉丁文字的语言。

Sources