OpenAI 实时 API 发布

OpenAI 在公开测试中推出了 Realtime API,允许付费开发者将低延迟、多模态的语音对语音对话集成到其应用中。该 API 消除了为转录、推理和语音合成而拼接多个模型的需求,只需一次 API 调用即可实现自然的对话体验。

技术架构与工作流程

Realtime API 用直接流式传输方式取代了传统的三步流水线——通过 Whisper 等模型进行自动语音识别(ASR)、使用基于文本的 LLM 进行推理以及使用文本转语音(TTS)模型进行合成。通过直接流式传输音频输入和输出,API 能降低延迟并保留情感细微差别、重音和口音,这些在基于文本的转录中通常会丢失。

关键技术特性包括:

  • 持久 WebSocket 连接:该 API 使用 WebSocket 与 GPT-4o 实时交换消息。
  • 自动中断处理:系统能够自动处理用户中断,行为类似于 ChatGPT 的 Advanced Voice Mode。
  • 函数调用:API 支持函数调用,使语音助手能够触发外部操作或获取实时上下文,例如下单或访问客户数据。

模型可用性与 API 选项

OpenAI 提供两条不同的音频集成路径,以满足应用的延迟需求:

  1. Realtime API:由 gpt-4o-realtime-preview 模型提供支持,旨在实现高速、自然的对话。
  2. Chat Completions API:由 gpt-4o-audio-preview 模型提供支持,允许开发者传入文本或音频并以文本、音频或两者兼有的形式获取响应。适用于不需要实时 API 极低延迟优势的场景。

定价与标记化

Realtime API 和 Chat Completions 的音频功能使用基于文本和音频标记的统一定价结构。

输入类型 每百万标记价格 每分钟估计成本
Text Input $5.00 N/A
Text Output $20.00 N/A
Audio Input $100.00 ~$0.06
Audio Output $200.00 ~$0.24

此外,文本和音频输入还提供缓存定价,分别降低至每百万缓存文本输入标记 $2.50 和每百万缓存音频输入标记 $20。

安全、隐私与合规

Realtime API 基于与 ChatGPT 的 Advanced Voice Mode 相同的 GPT-4o 版本构建,并采用相同的音频安全基础设施。安全措施包括:

  • 自动监控:持续监控并对标记的输入和输出进行人工审查,以降低滥用风险。
  • Preparedness Framework:根据 OpenAI 的 Preparedness Framework 进行评估,详见 GPT-4o 系统卡。
  • 红队测试:外部红队确认该 API 未在现有缓解措施之外引入高风险漏洞。
  • 隐私承诺:根据企业隐私承诺,OpenAI 在未获得明确许可的情况下不会使用此服务的输入或输出进行模型训练。

集成与生态系统

为促进部署,OpenAI 与多家基础设施合作伙伴合作:

  • LiveKit 和 Agora:提供音频组件的客户端库,如声音隔离、回声消除和重新连接。
  • Twilio:将 Realtime API 与 Twilio 的语音 API 集成,使 AI 代理能够通过传统语音通话与客户连接。

未来路线图

OpenAI 计划在向通用可用性迈进的过程中扩展 Realtime API 的功能,包括:

  • 额外模态:未来将支持视觉和视频。
  • 提升速率限制:将并发会话上限扩展至当前 Tier 5 的 100 会话以上。
  • 官方 SDK 支持:集成到官方 OpenAI Python 和 Node.js SDK 中。
  • 扩展模型支持:将在即将发布的模型版本中加入 GPT-4o mini。

Sources