Qwen3.5-LiveTranslate-Flash 发布说明

Qwen 已宣布 Qwen3.5-LiveTranslate-Flash,这是一款基于 Qwen3.5-Omni 架构的同声传译模型。该模型通过融合音频和视觉上下文,实现实时多模态翻译,并通过跨语言语音克隆提升翻译准确性和身份一致性。

关键技术升级

Qwen3.5-LiveTranslate-Flash 相较其前身 Qwen3-LiveTranslate,在语言覆盖、延迟和术语处理方面实现了显著提升。

扩展语言支持

模型大幅扩展了语言能力:

  • 输入音频和输出文本: 从 18 种语言增加到 60 种语言。
  • 输出音频: 从 10 种语言增加到 29 种语言。

通过可读单元技术实现超低延迟

为了最小化同声传译的延迟,模型采用了新颖的“可读单元”实时翻译技术。该策略在保持语义一致性和可读性的同时,允许更积极的流式输出。

性能基准显示,Qwen3.5-LiveTranslate-Flash 相比前一版本将首标记延迟降低了 3.45 秒,单标记延迟降低了 1.88 秒,实现了平均每标记 2.8 秒的语音到语音延迟。

实时语音克隆

系统可以从单句复制说话者的声线特征,使翻译后的语音在不同语言中听起来像原始说话者。此功能支持三种模式:预注册、一次克隆和实时。

动态热词增强

为降低专有名词和行业术语的误译,模型内置了热词功能。用户可以根据场景实时动态配置和更新人名、地点、品牌名和产品型号。

模型架构

Qwen3.5-LiveTranslate 基于 Qwen3.5-Omni Thinker‑Talker 架构:

  • Thinker(思考者): 处理交错的视觉和音频输入,生成文本翻译。
  • Talker(说话者): 使用翻译后的文本和源音频,生成带有跨语言语音克隆的语音。

为实现实时口译,模型采用块级流式输入机制和可读单元标签来控制语音合成的粒度。

多模态能力与使用场景

Qwen3.5-LiveTranslate-Flash 利用视觉上下文解决翻译歧义,使用屏幕文字或场景中的物体来选择词语或短语的正确含义。

关键应用场景包括:

  • 国际会议: 实时处理代码切换、多种口音和领域特定术语。
  • 旅行: 与 AI 眼镜集成,将视觉上下文(如菜单)与口语对话结合,实现设备端翻译。
  • 直播: 精准翻译产品规格和数值数据,以实现电商本地化。
  • 文学翻译: 将古文(如《三国演义》中的文言文)翻译成现代英语。

通过 DashScope API 实现

模型可通过 DashScope API 使用 WebSocket 连接(wss://dashscope.aliyuncs.com/api-ws/v1/realtime)访问。API 支持:

  • 模态: 可配置输出文本和音频,或仅文本。
  • 输入: PCM 音频块和图像帧,用于视觉上下文。
  • 自定义: 使用 corpus 字段注册热词,以提升特定短语的准确性。

未来发展方向

Qwen 计划通过以下重点进一步发展模型:

  • 进一步降低端到端延迟,逼近实时极限。
  • 扩展对低资源语言和地区方言的覆盖。
  • 提升长对话中术语和人名的一致性。
  • 增强语音克隆的保真度,涵盖环境音和现场氛围。
  • 融合手势、唇形和表情的联合多模态建模。

Sources