Qwen3.5-LiveTranslate-Flash 版本說明

Qwen 宣佈了 Qwen3.5-LiveTranslate-Flash,這是一款基於 Qwen3.5-Omni 架構的同聲傳譯模型。該模型透過整合音訊與視覺情境,實現即時、多模態翻譯,並藉由跨語言語音克隆提升翻譯準確度與身份一致性。

主要技術升級

相較於前代 Qwen3-LiveTranslate,Qwen3.5-LiveTranslate-Flash 在語言覆蓋、延遲與術語處理方面帶來顯著提升。

擴充語言支援

該模型的語言能力大幅擴展:

  • 輸入音訊與輸出文字: 從 18 種語言提升至 60 種語言。
  • 輸出音訊: 從 10 種語言提升至 29 種語言。

透過可讀單元技術實現超低延遲

為了將同聲傳譯的延遲降至最低,模型採用了新穎的「可讀單元」即時翻譯技術。此策略在保持語意一致性與可讀性的同時,允許更積極的串流輸出。

效能基準測試顯示,Qwen3.5-LiveTranslate-Flash 相較於前一版本,將首個 token 的延遲縮短了 3.45 秒,單 token 延遲縮短了 1.88 秒,達到平均語音對語音單 token 延遲 2.8 秒。

即時語音克隆

系統能夠從單一句子複製說話者的聲音特徵,使翻譯後的語音在不同語言中仍保有原說話者的音色。此功能支援三種模式:預先註冊、一次性克隆與即時克隆。

動態熱詞增強

為降低專有名詞與行業術語的誤譯,模型內建熱詞功能。使用者可依情境即時動態設定與更新人名、地名、品牌名稱與產品型號。

模型架構

Qwen3.5-LiveTranslate 基於 Qwen3.5-Omni Thinker-Talker 架構:

  • Thinker(思考者): 處理交錯的視覺與音訊輸入,產生文字翻譯。
  • Talker(說話者): 使用翻譯後的文字與原始音訊,產生具跨語言語音克隆的語音。

在即時傳譯方面,模型採用分塊串流輸入機制與可讀單元標籤,以控制語音合成的粒度。

多模態能力與使用案例

Qwen3.5-LiveTranslate-Flash 利用視覺情境解決翻譯歧義,透過螢幕文字或場景中的物件來選擇詞彙或片語的正確含義。

主要應用情境包括:

  • 國際會議: 即時處理語碼切換、多樣口音與領域專業術語。
  • 旅行: 結合 AI 眼鏡,將視覺情境(如菜單)與口語對話結合,實現裝置端翻譯。
  • 直播: 精準翻譯產品規格與數據,支援電商本地化。
  • 文學翻譯: 將古文(如《三國演義》中的文言文)翻譯成現代英文。

透過 DashScope API 實作

可透過 DashScope API 並使用 WebSocket 連線 (wss://dashscope.aliyuncs.com/api-ws/v1/realtime) 取得模型。API 支援:

  • 模態: 可設定輸出文字與音訊,或僅文字。
  • 輸入: PCM 音訊塊與影像幀,用於視覺情境。
  • 客製化: 使用 corpus 欄位註冊熱詞,以提升特定片語的準確度。

未來發展方向

Qwen 計畫持續演進模型,重點包括:

  • 進一步降低端到端延遲,接近即時上限。
  • 擴大對低資源語言與地方方言的覆蓋。
  • 提升長對話中術語與人名的一致性。
  • 增強語音克隆的真實度,納入環境聲音與現場氛圍。
  • 整合手勢、唇形與表情的多模態聯合建模。

Sources