Qwen3.8-LiveTranslate 模型发布

TL;DR

Qwen 发布了 Qwen3.8‑LiveTranslate,这是一个同步翻译系统,将平均延迟(LAAL)从 2.8 秒降低至 2.3 秒,引入了实时说话人分离与语音克隆、同步双语显示,以及针对 60 种输入语言的长上下文消歧功能。


关键技术进展

交错架构提升质量与延迟

"音频与文本交织在一起,质量更高,延迟更低。这一代将同步翻译重新定义为单一的音频-文本交错流;已听到的音频和已生成的翻译均可缓存并复用。" 交错流使模型能够将输入音频和生成的翻译视为因果序列,从而复用先前处理过的片段,将平均延迟(LAAL)从 2.8 秒降低至 2.3 秒

实时说话人分离与语音克隆

"当多人轮流发言时,模型能区分不同说话人及其所说内容,并帮助翻译语音更准确、更稳定地保留每位说话人的音色。" 每个翻译句子都会伴随说话人 ID 输出,Talker 模块会合成与原始说话人音色一致的语音。

同步源语言与翻译输出

"翻译过程中的双语对齐支持即时理解与源语言核对,为后续功能(如字幕显示、内容组织与检索)奠定基础。" 服务返回单一响应中的源语言转录与翻译内容,支持双语并排显示屏幕。

长上下文消歧

"通过利用先前文本与历史上下文,模型在复杂场景中减轻了专有名词、指代等的歧义,保持表达一致性。" Thinker 模块将早期对话回合纳入因果序列,提升了对姓名、术语和代词的处理能力。


模型架构

  • 混合专家(MoE)Thinker–Talker 设计
    • Thinker:接收视频、音频、源文本和视觉帧,将其整合为单一因果序列。
    • Talker:接收翻译文本和源音频,合成保留原始说话人音色的语音。
  • 端到端流式处理管道:音频 → 交错表示 → 翻译 → 语音合成。

性能评估

多说话人长音频基准(Omnilingua‑MSpeaker)

  • 覆盖 14 种语言方向,包含多说话人、长时长音频。
  • Qwen3.8‑LiveTranslate 在 翻译忠实度、流畅性、简洁性以及说话人分离错误率(DER) 上优于主流实时翻译系统。

多语言实时翻译(FLEURS 音频测试集)

  • 70 种语言方向 上进行评估。
  • 翻译质量、平均延迟、语音识别准确率和语音合成质量 上领先于前代 Qwen 模型及竞争系统。

原文未披露具体数值分数;声明仅限相对优势。


支持的语言

输入音频与输出文本(60 种) 输出音频(29 种)
阿非利堪斯语、阿拉伯语、阿斯图里亚斯语、阿塞拜疆语、白俄罗斯语、孟加拉语、波斯尼亚语、保加利亚语、粤语、加泰罗尼亚语、宿务语、中文、克罗地亚语、捷克语、丹麦语、荷兰语、英语、爱沙尼亚语、菲律宾语、芬兰语、法语、加利西亚语、古吉拉特语、德语、希腊语、希伯来语、印地语、匈牙利语、冰岛语、印度尼西亚语、意大利语、日语、爪哇语、卡纳达语、哈萨克语、韩语、吉尔吉斯语、拉脱维亚语、马其顿语、马来语、马拉雅拉姆语、马拉地语、挪威语、波斯语、波兰语、葡萄牙语、旁遮普语、罗马尼亚语、俄语、斯洛伐克语、斯洛文尼亚语、西班牙语、斯瓦希里语、瑞典语、塔吉克语、泰语、土耳其语、乌克兰语、乌尔都语、越南语 中文、英语、德语、意大利语、葡萄牙语、西班牙语、日语、韩语、法语、俄语、泰语、印度尼西亚语、阿拉伯语、越南语、土耳其语、芬兰语、波兰语、印地语、荷兰语、捷克语、乌尔都语、菲律宾语、瑞典语、丹麦语、希伯来语、冰岛语、马来语、挪威语、波斯语

通过 DashScope API 使用模型

该博客提供了一个完整的 Python 客户端,功能包括:

  1. 连接到 wss://{workspace_id}.cn-beijing.maas.aliyuncs.com/api-ws/v1/realtime?model=qwen3.8-livetranslate-flash-realtime 的 WebSocket。
  2. 配置会话以请求 文本 输出和可选的 音频 输出,启用说话人 ID 和源语言 ASR。
  3. 流式传输麦克风 PCM 数据块(16 kHz,16 位)至服务器。
  4. 接收增量翻译文本、合成音频和说话人标识符。
  5. 在后台线程中播放合成音频(当 audio_enabled 为 true 时)。

关键代码片段(为简洁起见省略):

config = {
    "session": {
        "output_modalities": ["text", "audio"] if self.audio_enabled else ["text"],
        "input_audio_format": "pcm",
        "output_audio_format": "pcm",
        "translation": {"language": self.target_language}
    }
}
await self.ws.send(json.dumps(config))

客户端处理 response.audio.deltaresponse.text.deltasession.finished 等事件,以实现实时翻译和干净关闭。


演示示例

该博客展示了《西游记》中的两段对话以及一组同音词示例,展示了:

  • 跨轮次的准确说话人归属与稳定的语音克隆。
  • 同步双语屏幕输出。
  • 利用视觉线索进行上下文感知的模糊术语消歧。

未来方向

Qwen 列出了三个研究重点:

  1. 延迟压缩 – 将端到端延迟推向同步翻译的理论极限。
  2. 跨会话长期记忆 – 在同一项目和参与者之间保留对话上下文。
  3. 扩展语言覆盖 – 增加更多长尾语言和区域方言,实现全球实时翻译。

引用

如果您在研究或产品中使用 Qwen3.8‑LiveTranslate,请按以下方式引用该博客文章:

@misc{qwen38livetranslateblog,
  title = {Qwen3.8-LiveTranslate: Names the speaker. Carries the meaning.},
  url = {https://qwen.ai/blog?id=qwen3.8-livetranslate},
  author = {Qwen Team},
  month = {September},
  year = {2026}
}

所有陈述均直接摘自 2026 年 9 月 18 日发布的 Qwen 博客文章。

Sources