OpenAI gpt-realtime 与 Realtime API 正式上线

OpenAI 已宣布 Realtime API 正式上线,并发布 gpt-realtime,这是一款面向生产环境的语音代理的全新语音到语音模型。此更新引入了对图像输入、远程模型上下文协议(MCP)服务器以及用于电话网络集成的会话发起协议(SIP)的原生支持,显著扩展了基于语音的 AI 代理的实用性。

gpt-realtime 模型

gpt-realtime 是一种原生语音到语音模型,直接处理和生成音频,无需单独的语音转文本和文本转语音流水线。该架构降低了延迟,并保留了人类语音的细微差别。

音频质量与表现力

该模型经过训练,可产生更自然的语调、情感和节奏。它能够遵循关于风格的细粒度指令,例如以“法式口音的共情方式”或“快速且专业的方式”进行讲话。OpenAI 引入了两个全新专属声音 Cedar 和 Marin,同时更新了已有的八种声音,以利用这些质量改进。

智能与推理

gpt-realtime 展示了对原生音频和非语言线索(如笑声)的更好理解。它可以在句子中途切换语言,并更准确地识别西班牙语、中文、日语和法语中的字母数字序列(例如电话号码或 VIN)。

在推理方面,该模型在 Big Bench Audio 基准上取得了 82.8% 的准确率,而 2024 年 12 月的模型为 65.6%。

指令遵循与函数调用

指令遵循的改进使模型能够更严格地遵守开发者提示,例如逐字朗读免责声明脚本。在 MultiChallenge 音频基准上,gpt-realtime 获得了 30.5% 的得分,高于前一模型的 20.6%。

函数调用能力在三个维度上得到增强:调用函数的相关性、调用时机以及参数的准确性。在 ComplexFuncBench 音频评估中,gpt-realtime 获得 66.5% 的得分,而前一模型为 49.7%。此外,模型现在原生支持异步函数调用,使对话在等待长时间运行的工具结果时仍保持流畅。

Realtime API 功能更新

除了模型更新,Realtime API 还引入了多项面向生产的功能:

  • 远程 MCP 服务器支持: 开发者可以在会话配置中提供远程 MCP 服务器 URL,以启用模型上下文协议(MCP)支持,让 API 自动处理工具调用,无需手动集成。
  • 图像输入: 模型现在可以在音频或文本的同时处理图像、照片和截图。这使得代理能够在视觉上下文中进行对话,用户可以询问模型在共享图像中“看到”了什么。
  • SIP 支持: 对会话发起协议(SIP)的直接支持,使开发者能够将语音代理连接到公共电话网络、PBX 系统和桌面电话。
  • 可复用提示: 开发者现在可以保存并复用提示——包括工具、变量和示例消息——跨不同的 Realtime API 会话使用。

安全、隐私与定价

为防止滥用,OpenAI 使用主动分类器监控会话,并可在违反有害内容指南时中止对话。建议开发者使用 Agents SDK 以获得额外的安全防护。使用政策要求开发者在用户与 AI 交互时进行披露,并禁止将服务用于垃圾信息或欺骗行为。

定价与可用性

gpt-realtime 已对所有开发者立即开放。相较于 gpt-4o-realtime-preview,定价已降低 20%:

  • 音频输入: 每 100 万 token $32(缓存输入 token 为 $0.40)。
  • 音频输出: 每 100 万 token $64。

开发者现在可以对会话上下文进行细粒度控制,设置 token 限制并截断回合,以在长会话中管理成本。

Sources