介绍 GPT‑Live‑1 和 GPT‑Live‑1 mini:OpenAI 的全双工语音模型
介绍 GPT‑Live‑1 和 GPT‑Live‑1 mini:OpenAI 的全双工语音模型
TL;DR
OpenAI 推出 GPT‑Live‑1 和 GPT‑Live‑1 mini,这是一代全双工语音模型,能够同时倾听和说话,将大量推理工作委派给 GPT‑5.5,并提供更自然的 ChatGPT 语音体验。
概览
我们正在推出 GPT‑Live,这一代语音模型让与 AI 的对话更像真实的交流。
GPT‑Live 基于全双工架构,能够同时倾听和说话。它可以通过“嗯”“对”等短语表现出专注,进行快速的来回交互,或在用户需要思考时保持沉默。
在发布时,GPT‑Live 在后台使用 GPT‑5.5 处理需要网页搜索、更深层推理或更复杂工作的任务,同时保持对话的流畅性。
今天发布了两个版本:GPT‑Live‑1 和 GPT‑Live‑1 mini,计划很快在 API 中提供。
技术架构
GPT‑Live 通过两项架构改进来解决这些限制。
通过全双工实现持续交互 – 与处理离散回合不同,GPT‑Live 在生成输出的同时持续处理输入,使其能够每秒多次决定是说话、倾听、暂停、打断或调用工具。这支持自然的来回交互、更好的时机感知以及实时翻译。
委派以完成更深层工作 – 交互层(GPT‑Live)与负责搜索、推理或代理任务的独立模型解耦。当问题需要这些能力时,GPT‑Live 将请求委派给前沿模型(如 GPT‑5.5),保持对话并在结果准备好时返回。这一设计还使 GPT‑Live 能够持续使用最新发布的前沿模型。
能力与用户体验
随着时间推移,我们相信这项研究还能解锁使用语音完成更复杂、时长更长且更具代理性的工作。
- 用户可以打断、暂停或让 ChatGPT 放慢语速;模型会以“嗯”“好的”等短语回应。
- 已为 GPT‑Live 重新制作了九种不同的声音。
- 在说话时,ChatGPT 可以展示天气、股票、体育等主题的丰富可视化卡片。
- 语音仍支持搜索、记忆、图像和文件上传。
- 推理深度可选:Instant(即时)用于快速响应,Medium(中等)和 High(高)用于需要更多思考时间的情况。
评估
我们构建了全新的人类评估,以衡量愉悦度和对话流畅性。
在 5–10 分钟的正面对话中,GPT‑Live‑1 和 GPT‑Live‑1 mini 在整体偏好、轮流发言、打断、对话流畅性和自然度方面均显著优于 Advanced Voice Mode。
源文档中提到的具体基准结果:
- GPQA:GPT‑Live‑1 在生物、化学和物理等领域的专家级科学推理上大幅超越 Advanced Voice Mode。
- BrowseComp:GPT‑Live‑1 在代理式网页搜索和查找难以定位信息方面相较 Advanced Voice Mode 有显著提升。
- τ³‑Voice Telecom(内部变体):GPT‑Live‑1 在真实的多轮电信支持任务上优于 Advanced Voice Mode。
安全性
GPT‑Live 的设计默认安全。
安全措施包括:
- 通过新的音频原生评估和合成评估扩展安全测试,重点关注自残、精神病与躁狂、对 AI 的情感依赖、暴力和性内容。
- 针对语音特有风险的内部红队测试。
- 实时安全防护,可将模型引导至更安全的回应、展示安全提示,或在高风险情形下结束对话。
- 为自残情形提供经过专家审查的危机求助热线支持流程。
- 将适龄行为直接训练进模型,以降低青少年不当回应;家长控制功能允许父母为青少年开启或关闭 ChatGPT 语音,并在高风险情形下收到通知。
- 持续的长期测量和发布后监控,重点关注情感依赖。
- 使用预定义的声音集合并配备防护措施,防止冒充真实人物的声音。
来源指出,GPT‑Live 在几乎所有评估的安全领域的表现与或优于 Advanced Voice Mode。
推出与可用性
我们今天开始向全球 ChatGPT 用户推出两款 GPT‑Live 版本——GPT‑Live‑1 和 GPT‑Live‑1 mini。
- GPT‑Live‑1 成为 Go、Plus 和 Pro 用户的默认 ChatGPT 语音模型。
- GPT‑Live‑1 mini 成为免费用户的默认模型。
- 推出覆盖 iOS、Android 和 ChatGPT.com。
- 开发者和企业可通过提供的表单报名,在模型通过 API 可用时获得通知。
- 旧版 ChatGPT 语音(Standard 和 Advanced Voice Mode)仍可在需要语音配合视频或屏幕共享等功能时使用。
限制与未来工作
在发布时,GPT‑Live 尚不支持在 ChatGPT 中进行语音+视频或屏幕共享,但我们正努力尽快引入这些功能。
- 对于某些语言,模型可能带有非母语口音或流利度不足;相关改进正在进行中。
- 我们的愿景是实现真正自然的人机交互,随着时间推移将语音扩展到更复杂、时长更长且更具代理性的工作。
以上所有陈述均直接摘自原始来源,未添加任何外部事实或数字。
Sources
- OriginalIntroducing GPT-Live