Qwen-MT Turbo 發行說明

Qwen 推出了 qwen-mt-turbo,這是 Qwen-MT 翻譯模型的升級版。模型基於 Qwen3,並在數兆多語言與翻譯語料上進行訓練,利用強化學習提升翻譯準確度與語言流暢度。

主要功能與特性

Qwen-MT 透過以下特性,在高效能翻譯與運營效率之間取得平衡:

  • 廣泛語言支援:模型支援 92 種主要官方語言及重要方言,覆蓋全球超過 95% 的人口。
  • 客製化工具:Qwen-MT 支援術語干預、領域提示與翻譯記憶。使用者可預先定義關鍵術語對,或以自然語言描述所需的風格與領域(例如,法律與社群媒體),以優化關鍵任務或特定領域的輸出。
  • 高效架構:採用輕量化的 Mixture of Experts(MoE)架構,模型降低延遲與 API 成本,價格低至每百萬輸出標記 $0.5。

翻譯品質與基準測試

自動評估

Qwen-MT 在 WMT24 多語言翻譯基準以及中英與英德多領域基準上進行測試。結果顯示,Qwen-MT 超越了同等規模的模型,包括 Gemini-2.5-Flash、GPT-4.1-mini 與 Qwen3-8B。與更大型的最先進模型如 Qwen3-235B-A22B、Gemini-2.5-Pro 與 GPT-4.1 相比,該模型在品質上仍具競爭力,同時提供更快的處理速度。

人類評估

為了彌補自動指標的局限,Qwen 使用真實世界資料在十種主要語言(阿拉伯語、中文、英語、法語、義大利語、日語、韓語、俄語、西班牙語與泰語)進行了人工評估。三位獨立的專業翻譯員對樣本進行打分,並使用交叉驗證以確保可靠性。Qwen-MT 在卓越率與接受率兩項指標上皆展現出優異表現。

支援的語言族群

Qwen-MT 支援廣泛的語言,依語系分類如下:

語言族群 支援語言
印歐語系 南非荷蘭語、亞美尼亞語、阿薩姆語、阿斯圖里亞斯語、白俄羅斯語、孟加拉語、波斯尼亞語、保加利亞語、加泰羅尼亞語、克羅埃西亞語、捷克語、丹麥語、荷蘭語、英語、法語、加利西亞語、德語、希臘語、古吉拉特語、印地語、冰島語、義大利語、拉脫維亞語、立陶宛語、盧森堡語、馬其頓語、邁蒂利語、馬拉地語、尼泊爾語、挪威語(書面語)、挪威語(新挪威語)、奧克語、奧里亞語、波蘭語、葡萄牙語、羅馬尼亞語、俄語、塞爾維亞語、西西里語、信德語、僧伽羅語、斯洛伐克語、斯洛文尼亞語、西班牙語、瑞典語、托斯克阿爾巴尼亞語、烏克蘭語、烏爾都語、威尼斯語、威爾斯語、西波斯語
漢藏語系 中文(粵語、簡體中文、繁體中文)、緬甸語
亞非語系 阿拉伯語(標準阿拉伯語、埃及阿拉伯語、美索不達米亞阿拉伯語、摩洛哥阿拉伯語、納季迪阿拉伯語、北黎凡特阿拉伯語、南黎凡特阿拉伯語、塔伊齊-亞丁阿拉伯語、突尼西亞阿拉伯語)、希伯來語、馬爾他語
南島語系 宿霧語、印尼語、爪哇語、馬來語、潘加辛語、他加祿語、瓦賴語
達羅毗荼語系 坎納達語、泰米爾語、泰盧固語
突厥語系 哈薩克語、北阿塞拜疆語、北烏茲別克語、土耳其語
台-卡岱語系 泰語、老撾語
烏拉爾語系 愛沙尼亞語、芬蘭語、匈牙利語
南亞語系 高棉語、越南語
其他 巴斯克語、格魯吉亞語、日語、韓語、斯瓦希里語

實作與 API 使用

Qwen-MT 可透過 Qwen API 存取。模型在 API 呼叫的 extra_body 參數中接受 translation_options,以處理特定的翻譯需求:

  • 術語干預:使用者可傳入包含來源與目標配對的 terms 清單(例如,將「脑䅈搗大吧」映射為「biological sensor」),以確保詞彙的一致應用。
  • 領域提示:使用者可指定 domains 參數以引導模型的風格。例如,說明文字來自「阿里雲 IT 領域」即可確保使用專業的故障排除術語與適當的句型。

Sources