Qwen3.8-LiveTranslate 模型发布
TL;DR
Qwen 发布了 Qwen3.8‑LiveTranslate,这是一个同步翻译系统,将平均延迟(LAAL)从 2.8 秒降低至 2.3 秒,引入了实时说话人分离与语音克隆、同步双语显示,以及针对 60 种输入语言的长上下文消歧功能。
关键技术进展
交错架构提升质量与延迟
"音频与文本交织在一起,质量更高,延迟更低。这一代将同步翻译重新定义为单一的音频-文本交错流;已听到的音频和已生成的翻译均可缓存并复用。" 交错流使模型能够将输入音频和生成的翻译视为因果序列,从而复用先前处理过的片段,将平均延迟(LAAL)从 2.8 秒降低至 2.3 秒。
实时说话人分离与语音克隆
"当多人轮流发言时,模型能区分不同说话人及其所说内容,并帮助翻译语音更准确、更稳定地保留每位说话人的音色。" 每个翻译句子都会伴随说话人 ID 输出,Talker 模块会合成与原始说话人音色一致的语音。
同步源语言与翻译输出
"翻译过程中的双语对齐支持即时理解与源语言核对,为后续功能(如字幕显示、内容组织与检索)奠定基础。" 服务返回单一响应中的源语言转录与翻译内容,支持双语并排显示屏幕。
长上下文消歧
"通过利用先前文本与历史上下文,模型在复杂场景中减轻了专有名词、指代等的歧义,保持表达一致性。" Thinker 模块将早期对话回合纳入因果序列,提升了对姓名、术语和代词的处理能力。
模型架构
- 混合专家(MoE)Thinker–Talker 设计
- Thinker:接收视频、音频、源文本和视觉帧,将其整合为单一因果序列。
- Talker:接收翻译文本和源音频,合成保留原始说话人音色的语音。
- 端到端流式处理管道:音频 → 交错表示 → 翻译 → 语音合成。
性能评估
多说话人长音频基准(Omnilingua‑MSpeaker)
- 覆盖 14 种语言方向,包含多说话人、长时长音频。
- Qwen3.8‑LiveTranslate 在 翻译忠实度、流畅性、简洁性以及说话人分离错误率(DER) 上优于主流实时翻译系统。
多语言实时翻译(FLEURS 音频测试集)
- 在 70 种语言方向 上进行评估。
- 在 翻译质量、平均延迟、语音识别准确率和语音合成质量 上领先于前代 Qwen 模型及竞争系统。
原文未披露具体数值分数;声明仅限相对优势。
支持的语言
| 输入音频与输出文本(60 种) | 输出音频(29 种) |
|---|---|
| 阿非利堪斯语、阿拉伯语、阿斯图里亚斯语、阿塞拜疆语、白俄罗斯语、孟加拉语、波斯尼亚语、保加利亚语、粤语、加泰罗尼亚语、宿务语、中文、克罗地亚语、捷克语、丹麦语、荷兰语、英语、爱沙尼亚语、菲律宾语、芬兰语、法语、加利西亚语、古吉拉特语、德语、希腊语、希伯来语、印地语、匈牙利语、冰岛语、印度尼西亚语、意大利语、日语、爪哇语、卡纳达语、哈萨克语、韩语、吉尔吉斯语、拉脱维亚语、马其顿语、马来语、马拉雅拉姆语、马拉地语、挪威语、波斯语、波兰语、葡萄牙语、旁遮普语、罗马尼亚语、俄语、斯洛伐克语、斯洛文尼亚语、西班牙语、斯瓦希里语、瑞典语、塔吉克语、泰语、土耳其语、乌克兰语、乌尔都语、越南语 | 中文、英语、德语、意大利语、葡萄牙语、西班牙语、日语、韩语、法语、俄语、泰语、印度尼西亚语、阿拉伯语、越南语、土耳其语、芬兰语、波兰语、印地语、荷兰语、捷克语、乌尔都语、菲律宾语、瑞典语、丹麦语、希伯来语、冰岛语、马来语、挪威语、波斯语 |
通过 DashScope API 使用模型
该博客提供了一个完整的 Python 客户端,功能包括:
- 连接到
wss://{workspace_id}.cn-beijing.maas.aliyuncs.com/api-ws/v1/realtime?model=qwen3.8-livetranslate-flash-realtime的 WebSocket。 - 配置会话以请求 文本 输出和可选的 音频 输出,启用说话人 ID 和源语言 ASR。
- 流式传输麦克风 PCM 数据块(16 kHz,16 位)至服务器。
- 接收增量翻译文本、合成音频和说话人标识符。
- 在后台线程中播放合成音频(当
audio_enabled为 true 时)。
关键代码片段(为简洁起见省略):
config = {
"session": {
"output_modalities": ["text", "audio"] if self.audio_enabled else ["text"],
"input_audio_format": "pcm",
"output_audio_format": "pcm",
"translation": {"language": self.target_language}
}
}
await self.ws.send(json.dumps(config))
客户端处理 response.audio.delta、response.text.delta 和 session.finished 等事件,以实现实时翻译和干净关闭。
演示示例
该博客展示了《西游记》中的两段对话以及一组同音词示例,展示了:
- 跨轮次的准确说话人归属与稳定的语音克隆。
- 同步双语屏幕输出。
- 利用视觉线索进行上下文感知的模糊术语消歧。
未来方向
Qwen 列出了三个研究重点:
- 延迟压缩 – 将端到端延迟推向同步翻译的理论极限。
- 跨会话长期记忆 – 在同一项目和参与者之间保留对话上下文。
- 扩展语言覆盖 – 增加更多长尾语言和区域方言,实现全球实时翻译。
引用
如果您在研究或产品中使用 Qwen3.8‑LiveTranslate,请按以下方式引用该博客文章:
@misc{qwen38livetranslateblog,
title = {Qwen3.8-LiveTranslate: Names the speaker. Carries the meaning.},
url = {https://qwen.ai/blog?id=qwen3.8-livetranslate},
author = {Qwen Team},
month = {September},
year = {2026}
}
所有陈述均直接摘自 2026 年 9 月 18 日发布的 Qwen 博客文章。