Qwen3-Omni-Flash-2025-12-01 發行說明

Qwen3-Omni-Flash-2025-12-01 是 Qwen3-Omni 原生多模態大型模型的全面升級版本。它能夠無縫處理文字、圖像、音訊與影片輸入,並透過即時串流回應,同時產生文字與自然音聲的輸出。

加強的音視互動與控制

Qwen3-Omni-Flash-2025-12-01 改善了多輪音視對話的穩定性與連貫性,解決了在日常口語情境中常見的「智慧下降」問題。模型現在透過更佳的音視指令理解與執行,提供更自然的互動體驗。

系統提示控制已加強,允許完整自訂模型行為。使用者現在可以細緻調整角色風格(例如動漫風、酷炫或甜美)、口語語調偏好,以及輸出長度限制。

多語言能力與語音合成

模型確保更可靠的多語言遵循,解決了先前版本的語言跟隨不穩定問題。它支援:

  • 文字互動:119 種語言
  • 語音辨識:19 種語言
  • 語音合成:10 種語言

語音合成已升級,消除機械或遲緩的表現。透過增強對韻律的自適應控制,模型會根據文字情境智慧地調整語調、停頓與說話速度,以模仿人類語音。

效能基準

Qwen3-Omni-Flash-2025-12-01 在所有模態上相較於 Qwen3-Omni-Flash 展現出顯著提升:

文字理解與生成

  • 邏輯推理:在 ZebraLogic 上提升 +5.6
  • 程式碼生成:在 LiveCodeBench-v6 上提升 +9.3,於 MultiPL-E 上提升 +2.7
  • 寫作品質:在 WritingBench 上提升 +2.2

語音理解與合成

  • 語音理解:VoiceBench 改善 (+3.2),且在 Fleurs-zh 上的字錯率顯著降低。
  • 語音合成:產生更高品質、類人聲音,具備改進的節奏與韻律,尤其在中文及多語言情境中表現更佳。

視覺與影片理解

  • 圖像理解:在視覺推理任務上取得提升,包括在 MMMU 上 +4.7、MMMU-Pro 上 +4.8,以及 MathVision_full 上 +2.2。
  • 影片理解:影片語意理解提升 (+1.6 在 MLVU),且即時對話的音視同步更為緊密。

未來發展路線圖

Qwen 團隊計畫在多個方向上推進模型,包括:

  • 多說話者 ASR(自動語音辨識)
  • 影片 OCR
  • 音視主動學習
  • 加強對基於代理的工作流程與函式呼叫的支援

Sources