OpenAI GPT-4o 发布说明

OpenAI 已推出 GPT-4o("omni"),这是一款多模态模型,旨在实现更自然的人机交互。通过在单一神经网络中处理文本、音频、图像和视频输入,并生成文本、音频和图像输出,GPT-4o 的响应时间可媲美人类对话。

端到端多模态架构

GPT-4o 用单一的端到端神经网络取代了语音模式中先前使用的多模型流水线。过去,语音模式依赖三个独立模型:一个用于音频转文本转录,一个用于文本处理(GPT-3.5GPT-4),以及一个用于文本转音频转换。该流水线导致了显著的信息损失,因为核心智能模型无法直接感知语调、背景噪音或多位说话者,也无法输出情感、歌唱或笑声。

通过在文本、视觉和音频上训练单一模型,GPT-4o 在同一网络中处理所有输入和输出,消除了使用独立模型时的流水线延迟和信息损失。

性能与延迟

GPT-4o 在英文文本和代码上的表现与 GPT-4 Turbo 相当,同时在非英文语言处理、视觉和音频理解方面提供了显著提升。

响应速度

GPT-4o 对音频输入的响应最快可达 232 毫秒,平均为 320 毫秒。这相比之前的语音模式有大幅度的延迟降低,后者在 GPT-3.5 上平均为 2.8 秒,在 GPT-4 上为 5.4 秒。

多语言分词

GPT-4o 使用全新分词器,在多种语言族上显著提升了压缩率。以下是 token 减少的示例:

  • Gujarati:4.4 倍更少的 tokens
  • Telugu:3.5 倍更少的 tokens
  • Tamil:3.3 倍更少的 tokens
  • Marathi:2.9 倍更少的 tokens
  • Hindi:2.9 倍更少的 tokens
  • Arabic:2.0 倍更少的 tokens
  • Russian:1.7 倍更少的 tokens
  • Korean:1.7 倍更少的 tokens
  • Chinese:1.4 倍更少的 tokens
  • Japanese:1.4 倍更少的 tokens
  • English:1.1 倍更少的 tokens

安全性与风险评估

GPT-4o 通过训练数据过滤和后训练行为微调,将安全性内置于设计之中。OpenAI 为语音输出实现了全新安全系统,并邀请了 70 多位来自误信息、偏见、社会心理等领域的专家进行外部红队测试。

风险评分卡

根据 OpenAI 的准备框架,GPT-4o 在任何类别中都未达到 “中等” 以上的风险等级。风险水平在缓解前后如下表所示:

类别 缓解前风险 缓解后风险
网络安全
CBRN
说服
模型自治

可用性与 API 定价

GPT-4o 已在 ChatGPT 中向免费用户和 Plus 用户开放,Plus 用户的消息上限最高可提升 5 倍。对于开发者,GPT-4o 以文本和视觉模型的形式提供 API,较 GPT-4 Turbo 有以下改进:

  • Speed:提升 2 倍
  • Cost:降低 50%(价格减半)
  • Rate Limits:提升 5 倍的速率限制

音频和视频功能将在未来几周内逐步向可信合作伙伴和 ChatGPT Plus Alpha 用户推出。

Sources