Qwen3.8-LiveTranslate 模型發布
TL;DR
Qwen 發布了 Qwen3.8‑LiveTranslate,這是一套即時口譯系統,將平均延遲(LAAL)從 2.8 秒降低至 2.3 秒,引入即時說話者分離與語音克隆、同步雙語顯示,以及針對 60 種輸入語言的長上下文消歧義功能。
主要技術進展
交錯架構提升品質與延遲
"音訊與文字交織在一起,品質更高且延遲更低。這一世代將即時口譯重新定義為單一的音訊-文字交錯串流;已聽過的音訊與已產生的翻譯皆可快取並重用。" 交錯串流讓模型能將即將到達的音訊與生成的翻譯視為因果序列,從而重用先前處理過的片段,將平均延遲(LAAL)從 2.8 秒降低至 2.3 秒。
即時說話者分離與語音克隆
"當多人輪流說話時,模型能區分不同說話者及其內容,並幫助翻譯語音更準確且穩定地保留每位說話者的音色。" 每個翻譯句子會附帶說話者 ID,而 Talker 模組會合成出與原始說話者音色相符的語音。
同步的源語言與翻譯輸出
"口譯過程中的雙語對齊支援即時理解與源語核對,為後續功能(如字幕顯示、內容組織與檢索)奠定基礎。" 服務會在單一回應中返回源語言文字稿與翻譯內容,支援雙語並列顯示螢幕。
長上下文消歧義
"透過利用先前文字與歷史上下文,模型能減輕複雜情境中專有名詞、指代等的模糊性,維持表達的一致性。" Thinker 模組將先前的對話回合納入因果序列,提升對姓名、專有名詞與代名詞的處理能力。
模型架構
- 混合-專家混合(MoE)Thinker–Talker 架構
- Thinker:接收影片、音訊、源文字與影像幀,將其整理為單一因果序列。
- Talker:接收翻譯文字與源音訊,合成保留原始說話者音色的語音。
- 端到端 流式處理管道:音訊 → 交錯表示 → 翻譯 → 語音合成。
性能評估
多說話者長音訊基準(Omnilingua‑MSpeaker)
- 涵蓋 14 種語言方向,包含多說話者與長時程音訊。
- Qwen3.8‑LiveTranslate 在 翻譯忠實度、流暢度、簡潔度與說話者辨識錯誤率(DER) 上超越主流即時口譯系統。
多語言即時口譯(FLEURS 音訊測試集)
- 在 70 種語言方向 上進行評估。
- 在 翻譯品質、平均延遲、語音辨識準確率與語音合成品質 上領先前代 Qwen 系列與競爭系統。
原始資料未提供具體數值分數;此說法僅限於相對優勢。
支援語言
| 輸入音訊與輸出文字(60 種) | 輸出音訊(29 種) |
|---|---|
| 阿非利堪語、阿拉伯語、阿斯圖里亞斯語、阿塞拜疆語、白俄羅斯語、孟加拉語、波士尼亞語、保加利亞語、粵語、加泰隆尼亞語、宿霧語、中文、克羅埃西亞語、捷克語、丹麥語、荷蘭語、英語、愛沙尼亞語、菲律賓語、芬蘭語、法語、加利西亞語、古吉拉特語、德語、希臘語、希伯來語、印地語、匈牙利語、冰島語、印尼語、義大利語、日語、爪哇語、卡納達語、哈薩克語、韓語、吉爾吉斯語、拉脫維亞語、馬其頓語、馬來語、馬拉雅拉姆語、馬拉地語、挪威語、波斯語、波蘭語、葡萄牙語、旁遮普語、羅馬尼亞語、俄語、斯洛伐克語、斯洛維尼亞語、西班牙語、斯瓦希里語、瑞典語、塔吉克語、泰語、土耳其語、烏克蘭語、烏爾都語、越南語 | 中文、英語、德語、義大利語、葡萄牙語、西班牙語、日語、韓語、法語、俄語、泰語、印尼語、阿拉伯語、越南語、土耳其語、芬蘭語、波蘭語、印地語、荷蘭語、捷克語、烏爾都語、菲律賓語、瑞典語、丹麥語、希伯來語、冰島語、馬來語、挪威語、波斯語 |
透過 DashScope API 使用模型
該部落格提供完整的 Python 客戶端,功能包括:
- 連接至
wss://{workspace_id}.cn-beijing.maas.aliyuncs.com/api-ws/v1/realtime?model=qwen3.8-livetranslate-flash-realtime的 WebSocket。 - 設定會話以請求 文字 輸出與可選的 音訊 輸出,啟用說話者 ID 與源語言 ASR。
- 流式傳輸麥克風的 PCM 資料區塊(16 kHz,16 位元)至伺服器。
- 接收逐步產生的翻譯文字、合成音訊與說話者識別資訊。
- 在背景執行緒中播放合成音訊(當
audio_enabled為 true 時)。
關鍵程式碼片段(為簡潔而節錄):
config = {
"session": {
"output_modalities": ["text", "audio"] if self.audio_enabled else ["text"],
"input_audio_format": "pcm",
"output_audio_format": "pcm",
"translation": {"language": self.target_language}
}
}
await self.ws.send(json.dumps(config))
客戶端會處理事件如 response.audio.delta、response.text.delta 與 session.finished,以實現即時翻譯與乾淨關閉。
示範案例
該部落格展示兩段《西遊記》對話與一組同音詞範例,說明:
- 跨回合的準確說話者歸屬與穩定語音克隆。
- 同步的雙語螢幕輸出。
- 利用視覺線索進行上下文感知的模糊詞語消歧義。
未來方向
Qwen 列出三個研究重點:
- 延遲壓縮 – 將端到端延遲推進至即時口譯的理論極限。
- 跨會話的長期記憶 – 在相同專案與參與者之間,保留對話上下文。
- 擴展語言覆蓋範圍 – 增加更多長尾語言與地區方言,實現全球即時口譯。
引用
若在研究或產品中使用 Qwen3.8‑LiveTranslate,請以以下方式引用該部落格文章:
@misc{qwen38livetranslateblog,
title = {Qwen3.8-LiveTranslate: Names the speaker. Carries the meaning.},
url = {https://qwen.ai/blog?id=qwen3.8-livetranslate},
author = {Qwen Team},
month = {September},
year = {2026}
}
所有陳述皆直接取自 2026 年 9 月 18 日發布的 Qwen 部落格文章。