Qwen-MT Turbo 发布说明

Qwen 推出了 qwen-mt-turbo,这是 Qwen-MT 翻译模型的更新版本。该模型基于 Qwen3 构建,并在数万亿多语言和翻译标记上进行训练,利用强化学习提升翻译准确性和语言流畅度。

关键能力与特性

Qwen-MT 通过以下特性在高性能翻译和运营效率之间取得平衡:

  • 广泛语言支持:模型支持 92 种主要官方语言及重要方言,覆盖全球超过 95% 的人口。
  • 定制工具:Qwen-MT 支持术语干预、领域提示和翻译记忆。这使用户能够预定义关键术语对,或提供自然语言描述所需的风格和领域(例如,法律 vs. 社交媒体),以在关键任务或特定领域场景中优化输出。
  • 高效架构:采用轻量级专家混合(Mixture of Experts,MoE)架构,模型降低了延迟和 API 成本,价格低至每百万输出标记 0.5 美元。

翻译质量与基准测试

自动评估

Qwen-MT 在 WMT24 多语言翻译基准以及中英和英德多领域基准上进行测试。结果表明,Qwen-MT 超越了规模相当的模型,包括 Gemini-2.5-Flash、GPT-4.1-mini 和 Qwen3-8B。在质量方面,面对更大规模的最先进模型如 Qwen3-235B-A22B、Gemini-2.5-Pro 和 GPT-4.1 时,Qwen-MT 仍保持竞争力,同时提供更快的处理速度。

人类评估

为弥补自动指标的局限性,Qwen 使用真实数据对十种主要语言进行人工评估:阿拉伯语、中文、英语、法语、意大利语、日语、韩语、俄语、西班牙语和泰语。三位独立的专业译者对样本进行打分,并采用交叉验证确保可靠性。Qwen-MT 在卓越率和接受率方面均表现出色。

支持的语言族

语言族 支持的语言
印欧语系 Afrikaans, Armenian, Assamese, Asturian, Belarusian, Bengali, Bosnian, Bulgarian, Catalan, Croatian, Czech, Danish, Dutch, English, French, Galician, German, Greek, Gujarati, Hindi, Icelandic, Italian, Latvian, Lithuanian, Luxembourgish, Macedonian, Maithili, Marathi, Nepali, Norwegian Bokmål, Norwegian Nynorsk, Occitan, Odia, Polish, Portuguese, Romanian, Russian, Serbian, Sicilian, Sindhi, Sinhala, Slovak, Slovenian, Spanish, Swedish, Tosk Albanian, Ukrainian, Urdu, Venetian, Welsh, Western Persian
汉藏语系 Chinese (Cantonese, Simplified, and Traditional), Burmese
阿弗罗-亚细亚语系 Arabic (Standard, Egyptian, Mesopotamian, Moroccan, Najdi, North Levantine, South Levantine, Ta’izzi-Adeni, and Tunisian), Hebrew, Maltese
南岛语系 Cebuano, Indonesian, Javanese, Malay, Pangasinan, Tagalog, Waray
达罗毗荼语系 Kannada, Tamil, Telugu
突厥语系 Kazakh, North Azerbaijani, Northern Uzbek, Turkish
台-卡岱语系 Thai, Lao
乌拉尔语系 Estonian, Finnish, Hungarian
南亚语系 Khmer, Vietnamese
其他 Basque, Georgian, Japanese, Korean, Swahili

实现与 API 使用

Qwen-MT 可通过 Qwen API 访问。模型在 API 调用的 extra_body 参数中接受 translation_options,以处理特定的翻译需求:

  • 术语干预:用户可以传入包含源语言和目标语言对的 terms 列表(例如,将 “脑䅈搗大吧” 映射为 “biological sensor”),以确保词汇的一致使用。
  • 领域提示:用户可以指定 domains 参数来引导模型的风格。例如,提供文本来源于 “阿里云 IT 领域” 的描述,可确保使用专业的故障排除术语和适当的句式。

Sources