Qwen2.5‑Omni 發布:即時互動的端到端多模態模型

Qwen 宣布推出 Qwen2.5-Omni,這是一款旗艦級的端到端多模態模型,旨在實現文字、圖像、音訊與影片的全方位感知。該模型支援即時串流回應,既能產生文字,又能合成自然語音,提供多模態互動的統一介面。

Thinker‑Talker 架構

Qwen2.5-Omni 採用全新「Thinker‑Talker」架構,以實現無縫的多模態處理與生成。此架構將模型的功能角色分為兩個主要組件:

  • Thinker:作為核心處理單元,Thinker 為一個支援音訊與圖像編碼器的 Transformer 解碼器。它處理文字、音訊與影片等多種輸入,產生高階表徵與文字。
  • Talker:作為輸出機制,Talker 為雙軌自回歸 Transformer 解碼器。它以串流方式接收來自 Thinker 的高維表徵與文字,流暢地輸出離散語音代碼。

由於 Talker 共享 Thinker 的所有歷史上下文資訊,系統以單一一致的模型運作,允許端到端的訓練與推論。

時間對齊多模態 RoPE(TMRoPE)

為了同步影片輸入的時間戳與音訊,Qwen2.5-Omni 引入了 TMRoPE(Time‑aligned Multimodal RoPE),這是一種專為多模態同步設計的全新位置嵌入方式。

能力與效能

Qwen2.5-Omni 針對即時語音與影片聊天而設計,支援分塊輸入與即時輸出。它在多種模態上展現出強勁表現,常常與同等規模的單模態模型相媲美。

多模態整合

在需要整合多種模態的任務上,Qwen2.5‑Omni 在 OmniBench 基準上達到最先進的表現。

單模態效能

模型在多個專業領域展現高水準的能力:

  • 音訊:在音訊能力上超越同等規模的 Qwen2‑Audio,並在語音辨識(Common Voice)、翻譯(CoVoST2)與音訊理解(MMAU)上取得優異成績。
  • 視覺:在圖像推理(MMMU、MMStar)與影片理解(MVBench)上表現與 Qwen2.5‑VL‑7B 相當。
  • 語音生成:在語音生成的穩健性與自然度上優於其他模型,評估依據包括 Seed‑tts‑eval 以及主觀自然度測試。
  • 指令遵循:端到端語音指令遵循的效能與使用文字輸入時相當,相關基準包括 MMLU 與 GSM8K。

未來發展

Qwen 計畫進一步提升 Qwen2.5‑Omni 的語音指令遵循能力,並加強協同的音視覺理解。實驗室亦致力於整合更多模態,朝向完整的全能模型邁進。

Sources