OpenAI GPT‑Live‑1 API release
TL;DR
OpenAI 在 API 中发布了 GPT‑Live‑1,这是一种全双工语音模型,可以同时进行聆听和说话,从而显著提升了语音交互应用的打断处理能力、延迟和对话自然度。
What GPT‑Live‑1 Is
GPT‑Live‑1 是一个在统一架构中同时执行自动语音识别 (ASR)、推理和文本转语音 (TTS) 的单一模型。它最初在 ChatGPT 中进行演示,现在已通过 OpenAI API 向开发者开放。
核心能力包括:
- Simultaneous listening and speaking – 模型在生成输出语音的同时处理输入音频,消除了对独立 STT‑LLM‑TTS 流水线的需求。
- Smooth interruption handling – 它能同时对输入和输出音频进行推理,与基于回合的系统相比,打断处理能力提升了高达 80%(根据 Speak 的早期评估结果)。
- Delegation to backend models – 更深层的推理和工具调用可以卸载到文本模型,例如 GPT‑6 Astra 或第三方模型。
- Customizable tone, pace, and style – 开发者可以通过系统提示词 (system prompt) 控制代理 (agent) 的语音特征。
- Robust background‑noise management – 模型能够区分静音和环境音,而不会中断对话流。
- Long‑session reliability – 它能在长时间的交互中保留上下文,从而提高对话质量。
- Telephony support – 为电话类用例(如预订和客户支持)提供全双工代理。
Architectural Simplification and Latency Reduction
传统的语音代理 (agent) 将独立的语音转文本、推理和文本转语音组件缝合在一起。每次交接都会增加延迟并引入故障点,尤其是在用户打断或停顿时。
GPT‑Live‑1 将这一堆栈简化为单一模型,处理以下内容:
- ASR transcription – 提供用户语音的实时文本。
- Turn detection – 识别用户何时结束说话,即使在非基于回合的设置中。
- Response generation – 在聆听打断的同时生成响应语音。
- Tool delegation – 将复杂查询转发给后端模型(例如,用于高容量任务的 Luna,用于细致推理的 Astra)。
通过在后台进行推理的同时保持对话进行,开发者可以实现更低的端到端延迟和更自然的节奏。
Measured Full‑Duplex Advantages
OpenAI 的内部评估显示 GPT‑Live‑1 具有显著优势:
- Full Duplex Bench 性能比 GPT‑Realtime‑2.1 提升了 30 个百分点,且回合切换延迟显著降低。
- 当与 GPT‑6 Astra (medium reasoning effort) 配合使用时,GPT‑Live‑1 在 Tau3 指标上排名第一,该指标用于衡量端到端任务中前沿语音代理的智能水平。
- 在航空、零售、电信和银行的语音客户服务基准测试中,该模型在任务成功率、打断处理和工具使用准确性方面均获得了更高的 Pass@1 分数。
这些结果表明,统一的全双工架构可以在速度和任务成功率方面都优于现有的最佳模块化流水线。
New Voice Options and Language Coverage
GPT‑Live‑1 扩展了之前提供的有限实时语音集。开发者现在可以从更广泛的口音、方言和语言中进行选择,首选提供了一种受澳大利亚英语影响的语音。OpenAI 计划在未来几个月内继续添加更多语音和语言支持。
Pricing and Availability
- Front‑end voice layer: $0.05 per minute.
- 该模型现已通过 API 开放;开发者可以将其与任何符合其成本和性能要求的后端模型或工具框架 (tool harness) 工具集进行配对。
- 通过销售人员联系或通过 OpenAI Presence 获取自定义语音访问权和企业级部署方案,后者利用 GPT‑Live‑1 实现企业环境中可信赖的实时语音交互。
How Developers Can Use GPT‑Live‑1
- Start a session – 调用 API,自然地说话,并测试在嘈杂环境(如咖啡馆、城市街道)中的打断处理能力。
- Shape the agent – 设置系统提示词 (system prompt) 以调整音调、节奏和对话风格。
- Delegate reasoning – 配置后端模型(例如 GPT‑6 Astra)以处理复杂查询或工具调用。
- Integrate with existing workflows – 使用提供的 ASR 转录文本和响应文本用于日志记录、分析或下游处理。
Customer Feedback Snapshot
早期采用者报告称,GPT‑Live‑1 的打断处理能力允许学习者在导师 (tutor) 响应之前有更多的思考时间,与之前的基于回合的系统相比,减少了近 80% 的打断次数。
Takeaway
GPT‑Live‑1 的发布标志着从碎片化的语音流水线向统一、全双工模型的转变,从而实现更低的延迟、更好的打断处理、能力更丰富的定制化,为消费级和企业级领域的自然语音优先应用开启了新的可能性。