Qwen3.5-LiveTranslate-Flash 版本說明
Qwen 宣佈了 Qwen3.5-LiveTranslate-Flash,這是一款基於 Qwen3.5-Omni 架構的同聲傳譯模型。該模型透過整合音訊與視覺情境,實現即時、多模態翻譯,並藉由跨語言語音克隆提升翻譯準確度與身份一致性。
主要技術升級
相較於前代 Qwen3-LiveTranslate,Qwen3.5-LiveTranslate-Flash 在語言覆蓋、延遲與術語處理方面帶來顯著提升。
擴充語言支援
該模型的語言能力大幅擴展:
- 輸入音訊與輸出文字: 從 18 種語言提升至 60 種語言。
- 輸出音訊: 從 10 種語言提升至 29 種語言。
透過可讀單元技術實現超低延遲
為了將同聲傳譯的延遲降至最低,模型採用了新穎的「可讀單元」即時翻譯技術。此策略在保持語意一致性與可讀性的同時,允許更積極的串流輸出。
效能基準測試顯示,Qwen3.5-LiveTranslate-Flash 相較於前一版本,將首個 token 的延遲縮短了 3.45 秒,單 token 延遲縮短了 1.88 秒,達到平均語音對語音單 token 延遲 2.8 秒。
即時語音克隆
系統能夠從單一句子複製說話者的聲音特徵,使翻譯後的語音在不同語言中仍保有原說話者的音色。此功能支援三種模式:預先註冊、一次性克隆與即時克隆。
動態熱詞增強
為降低專有名詞與行業術語的誤譯,模型內建熱詞功能。使用者可依情境即時動態設定與更新人名、地名、品牌名稱與產品型號。
模型架構
Qwen3.5-LiveTranslate 基於 Qwen3.5-Omni Thinker-Talker 架構:
- Thinker(思考者): 處理交錯的視覺與音訊輸入,產生文字翻譯。
- Talker(說話者): 使用翻譯後的文字與原始音訊,產生具跨語言語音克隆的語音。
在即時傳譯方面,模型採用分塊串流輸入機制與可讀單元標籤,以控制語音合成的粒度。
多模態能力與使用案例
Qwen3.5-LiveTranslate-Flash 利用視覺情境解決翻譯歧義,透過螢幕文字或場景中的物件來選擇詞彙或片語的正確含義。
主要應用情境包括:
- 國際會議: 即時處理語碼切換、多樣口音與領域專業術語。
- 旅行: 結合 AI 眼鏡,將視覺情境(如菜單)與口語對話結合,實現裝置端翻譯。
- 直播: 精準翻譯產品規格與數據,支援電商本地化。
- 文學翻譯: 將古文(如《三國演義》中的文言文)翻譯成現代英文。
透過 DashScope API 實作
可透過 DashScope API 並使用 WebSocket 連線 (wss://dashscope.aliyuncs.com/api-ws/v1/realtime) 取得模型。API 支援:
- 模態: 可設定輸出文字與音訊,或僅文字。
- 輸入: PCM 音訊塊與影像幀,用於視覺情境。
- 客製化: 使用
corpus欄位註冊熱詞,以提升特定片語的準確度。
未來發展方向
Qwen 計畫持續演進模型,重點包括:
- 進一步降低端到端延遲,接近即時上限。
- 擴大對低資源語言與地方方言的覆蓋。
- 提升長對話中術語與人名的一致性。
- 增強語音克隆的真實度,納入環境聲音與現場氛圍。
- 整合手勢、唇形與表情的多模態聯合建模。