Qwen3.8-LiveTranslate 模型發布

TL;DR

Qwen 發布了 Qwen3.8‑LiveTranslate,這是一套即時口譯系統,將平均延遲(LAAL)從 2.8 秒降低至 2.3 秒,引入即時說話者分離與語音克隆、同步雙語顯示,以及針對 60 種輸入語言的長上下文消歧義功能。


主要技術進展

交錯架構提升品質與延遲

"音訊與文字交織在一起,品質更高且延遲更低。這一世代將即時口譯重新定義為單一的音訊-文字交錯串流;已聽過的音訊與已產生的翻譯皆可快取並重用。" 交錯串流讓模型能將即將到達的音訊與生成的翻譯視為因果序列,從而重用先前處理過的片段,將平均延遲(LAAL)從 2.8 秒降低至 2.3 秒

即時說話者分離與語音克隆

"當多人輪流說話時,模型能區分不同說話者及其內容,並幫助翻譯語音更準確且穩定地保留每位說話者的音色。" 每個翻譯句子會附帶說話者 ID,而 Talker 模組會合成出與原始說話者音色相符的語音。

同步的源語言與翻譯輸出

"口譯過程中的雙語對齊支援即時理解與源語核對,為後續功能(如字幕顯示、內容組織與檢索)奠定基礎。" 服務會在單一回應中返回源語言文字稿與翻譯內容,支援雙語並列顯示螢幕。

長上下文消歧義

"透過利用先前文字與歷史上下文,模型能減輕複雜情境中專有名詞、指代等的模糊性,維持表達的一致性。" Thinker 模組將先前的對話回合納入因果序列,提升對姓名、專有名詞與代名詞的處理能力。


模型架構

  • 混合-專家混合(MoE)Thinker–Talker 架構
    • Thinker:接收影片、音訊、源文字與影像幀,將其整理為單一因果序列。
    • Talker:接收翻譯文字與源音訊,合成保留原始說話者音色的語音。
  • 端到端 流式處理管道:音訊 → 交錯表示 → 翻譯 → 語音合成。

性能評估

多說話者長音訊基準(Omnilingua‑MSpeaker)

  • 涵蓋 14 種語言方向,包含多說話者與長時程音訊。
  • Qwen3.8‑LiveTranslate 在 翻譯忠實度、流暢度、簡潔度與說話者辨識錯誤率(DER) 上超越主流即時口譯系統。

多語言即時口譯(FLEURS 音訊測試集)

  • 70 種語言方向 上進行評估。
  • 翻譯品質、平均延遲、語音辨識準確率與語音合成品質 上領先前代 Qwen 系列與競爭系統。

原始資料未提供具體數值分數;此說法僅限於相對優勢。


支援語言

輸入音訊與輸出文字(60 種) 輸出音訊(29 種)
阿非利堪語、阿拉伯語、阿斯圖里亞斯語、阿塞拜疆語、白俄羅斯語、孟加拉語、波士尼亞語、保加利亞語、粵語、加泰隆尼亞語、宿霧語、中文、克羅埃西亞語、捷克語、丹麥語、荷蘭語、英語、愛沙尼亞語、菲律賓語、芬蘭語、法語、加利西亞語、古吉拉特語、德語、希臘語、希伯來語、印地語、匈牙利語、冰島語、印尼語、義大利語、日語、爪哇語、卡納達語、哈薩克語、韓語、吉爾吉斯語、拉脫維亞語、馬其頓語、馬來語、馬拉雅拉姆語、馬拉地語、挪威語、波斯語、波蘭語、葡萄牙語、旁遮普語、羅馬尼亞語、俄語、斯洛伐克語、斯洛維尼亞語、西班牙語、斯瓦希里語、瑞典語、塔吉克語、泰語、土耳其語、烏克蘭語、烏爾都語、越南語 中文、英語、德語、義大利語、葡萄牙語、西班牙語、日語、韓語、法語、俄語、泰語、印尼語、阿拉伯語、越南語、土耳其語、芬蘭語、波蘭語、印地語、荷蘭語、捷克語、烏爾都語、菲律賓語、瑞典語、丹麥語、希伯來語、冰島語、馬來語、挪威語、波斯語

透過 DashScope API 使用模型

該部落格提供完整的 Python 客戶端,功能包括:

  1. 連接至 wss://{workspace_id}.cn-beijing.maas.aliyuncs.com/api-ws/v1/realtime?model=qwen3.8-livetranslate-flash-realtime 的 WebSocket。
  2. 設定會話以請求 文字 輸出與可選的 音訊 輸出,啟用說話者 ID 與源語言 ASR。
  3. 流式傳輸麥克風的 PCM 資料區塊(16 kHz,16 位元)至伺服器。
  4. 接收逐步產生的翻譯文字、合成音訊與說話者識別資訊。
  5. 在背景執行緒中播放合成音訊(當 audio_enabled 為 true 時)。

關鍵程式碼片段(為簡潔而節錄):

config = {
    "session": {
        "output_modalities": ["text", "audio"] if self.audio_enabled else ["text"],
        "input_audio_format": "pcm",
        "output_audio_format": "pcm",
        "translation": {"language": self.target_language}
    }
}
await self.ws.send(json.dumps(config))

客戶端會處理事件如 response.audio.deltaresponse.text.deltasession.finished,以實現即時翻譯與乾淨關閉。


示範案例

該部落格展示兩段《西遊記》對話與一組同音詞範例,說明:

  • 跨回合的準確說話者歸屬與穩定語音克隆。
  • 同步的雙語螢幕輸出。
  • 利用視覺線索進行上下文感知的模糊詞語消歧義。

未來方向

Qwen 列出三個研究重點:

  1. 延遲壓縮 – 將端到端延遲推進至即時口譯的理論極限。
  2. 跨會話的長期記憶 – 在相同專案與參與者之間,保留對話上下文。
  3. 擴展語言覆蓋範圍 – 增加更多長尾語言與地區方言,實現全球即時口譯。

引用

若在研究或產品中使用 Qwen3.8‑LiveTranslate,請以以下方式引用該部落格文章:

@misc{qwen38livetranslateblog,
  title = {Qwen3.8-LiveTranslate: Names the speaker. Carries the meaning.},
  url = {https://qwen.ai/blog?id=qwen3.8-livetranslate},
  author = {Qwen Team},
  month = {September},
  year = {2026}
}

所有陳述皆直接取自 2026 年 9 月 18 日發布的 Qwen 部落格文章。

Sources