OpenAI 下一代音频模型 API 发布
OpenAI 在其 API 中推出了一套全新的音频模型,以实现更智能且可定制的语音代理的开发。这些模型引入了最先进的语音转文本准确性以及首个可引导的文本转语音功能,允许开发者根据特定指令控制模型的发声方式。
增强的语音转文本功能
OpenAI 推出了 gpt-4o-transcribe 和 gpt-4o-mini-transcribe,在准确性和可靠性方面优于之前的 Whisper 模型。这些模型专为处理具有挑战性的音频环境而设计,包括语速变化、嘈杂背景和多样口音。
关键改进包括:
- 降低词错误率(WER): 新模型在多个基准测试中实现了更低的 WER,包括覆盖 100 多种语言的多语言 FLEURS 基准。
- 基准性能: 这些模型在所有语言评估中始终优于 Whisper v2 和 Whisper v3。
- 用例优化: 提高的转录可靠性使这些模型在会议记录转写和客户呼叫中心等场景中特别有效。
可引导的文本转语音
全新的 gpt-4o-mini-tts 模型引入了可引导性,允许开发者指示模型的表达方式和语调。开发者首次可以提供诸如“像同情的客服代表一样说话”等指令,以自定义声音的情感共鸣和风格。
此功能支持多种定制化应用,包括用于讲故事的富有表现力的叙述以及富有同理心的客服互动。这些模型目前仅限于人工合成的预设声音,以确保与合成预设相匹配。
技术创新
下一代音频模型基于 GPT-4o 和 GPT-4o-mini 架构构建,并采用了多项关键技术进步:
预训练与数据集
- 以音频为中心的预训练: 这些模型在专门的音频数据集上进行了大量预训练,以优化性能并提供对语音细微差别的更深入洞察。
蒸馏方法论
- 高级蒸馏: OpenAI 使用了增强的蒸馏技术和自我对弈方法,将大型音频模型的知识转移到更小、更高效的版本。这确保了小模型通过复制真实的用户-助手交互,保持高水平的对话质量和响应性。
强化学习
- 强化学习主导范式: 对于语音转文本模型,集成了强化学习主导的方法,以将转录准确性提升至业界领先水平,特别是减少幻觉并在复杂识别场景中提升精度。
API 可用性与集成
这些模型通过语音转文本和文本转语音 API 向所有开发者开放。为简化语音代理的开发,OpenAI 发布了与 Agents SDK 的集成。对于需要低延迟语音转语音体验的开发者,OpenAI 推荐使用实时 API 中提供的语音转语音模型。
未来路线图
OpenAI 计划继续提升音频模型的智能性和准确性。未来目标包括探索让开发者自定义语音的方式,同时保持安全标准。此外,OpenAI 正在投资其他模态,包括视频,以支持多模态代理体验的创建的。