Gemini 3.5 Transcribe 发布说明
Google DeepMind 推出了 Gemini 3.5 Transcribe,这是一款高精度语音转文本模型,旨在将原始音频直接转换为精炼且格式化的文本。该模型通过处理背景噪音、复杂术语以及不流利现象(如填充词和自我修正)进行了改进,能够生成适用于实时语音交互的清晰转录文本。
开发者访问权限与 API 实现
Gemini 3.5 Transcribe 通过两种不同的 API 提供,以支持不同的开发者工作流:
- 实时流式传输 (
gemini-3.5-transcribe-live): 通过 Live API 提供,该版本提供具有亚秒级延迟的连续、双向流式传输,适用于交互式语音应用。 - 预录音频处理 (
gemini-3.5-transcribe): 通过 Interactions API 提供,该版本针对录音、会议和通话记录进行了优化,具有说话人归属功能和词级时间戳。
开发者可以通过 Google AI Studio 和 Gemini Enterprise Agent Platform 中的 Gemini API 访问这些模型。
技术能力与性能
Gemini 3.5 Transcribe 引入了多项“智能转录”功能,并相比之前的 Chirp 3 模型在性能上有所提升:
转录精度与智能
- 不流利现象清理: 模型会自动移除填充词(例如,“ums”和“ahs”)并处理自我修正(例如,“让我们周二见面——不,周三”)。
- 自定义词汇: 模型可以通过提供的自定义词汇列表来适应专业术语和独特的拼写。
- 多语言支持: 它能自动检测并转录超过 85 种语言,包括各种地区口音和方言。
- 多说话人识别: 对于预录音频,模型可以将语音归属于最多三位说话人并附带时间戳(支持超过三位说话人目前处于实验阶段)。
- 函数调用 (Function Calling): 在 Gemini macOS 应用中,模型可以通过函数调用将复杂任务(如文件分析或图像生成)委派给其他 Gemini 模型。
基准测试与准确性
根据 Artificial Analysis 的测量,Gemini 3.5 Transcribe 在流式传输场景下实现了 4.0% 的平均字错率 (WER),在非流式传输场景下实现了 2.6% 的 WER。在涵盖顶级语言和地区的 FLEURS 基准测试中,它在流式模式下实现了 5.50% 的 WER,在非流式模式下实现了 5.04% 的 WER。
与 Chirp 3 相比,该模型在生成最终转录文本所需的时间上提升了 70%。
产品集成
Gemini 3.5 Transcribe 集成在多个 Google 产品中,以实现上下文感知的语音交互:
- Gboard (Android): “Rambler”功能使用该模型将口述想法转换为格式化文本,并允许通过语音驱动的编辑和样式更改。
- Google Antigravity: 模型利用屏幕上下文和聊天记录来提高文件名和活动文档转录的准确性。
- Gemini app (macOS): 支持自然语音转录和语音命令,并可结合屏幕上下文来总结本地文件或生成图像。
- Google AI Studio: 在 Build 模式下可用,用于语音驱动的应用开发(“vibe coding”)。
- Chrome: 即将推出,该模型将在任何 Web 表单字段中启用“语音输入”功能。
生态系统采用
多个开发者平台已集成 Gemini Live API 以促进语音驱动界面的部署,包括 Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel, 和 Vision Agents。此外,Vivo, Intellitek Health, 和 Lingopal 等公司也报告了该模型在延迟和语言支持方面的积极结果。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch