Qwen2.5‑Omni 發布:即時互動的端到端多模態模型
Qwen 宣布推出 Qwen2.5-Omni,這是一款旗艦級的端到端多模態模型,旨在實現文字、圖像、音訊與影片的全方位感知。該模型支援即時串流回應,既能產生文字,又能合成自然語音,提供多模態互動的統一介面。
Thinker‑Talker 架構
Qwen2.5-Omni 採用全新「Thinker‑Talker」架構,以實現無縫的多模態處理與生成。此架構將模型的功能角色分為兩個主要組件:
- Thinker:作為核心處理單元,Thinker 為一個支援音訊與圖像編碼器的 Transformer 解碼器。它處理文字、音訊與影片等多種輸入,產生高階表徵與文字。
- Talker:作為輸出機制,Talker 為雙軌自回歸 Transformer 解碼器。它以串流方式接收來自 Thinker 的高維表徵與文字,流暢地輸出離散語音代碼。
由於 Talker 共享 Thinker 的所有歷史上下文資訊,系統以單一一致的模型運作,允許端到端的訓練與推論。
時間對齊多模態 RoPE(TMRoPE)
為了同步影片輸入的時間戳與音訊,Qwen2.5-Omni 引入了 TMRoPE(Time‑aligned Multimodal RoPE),這是一種專為多模態同步設計的全新位置嵌入方式。
能力與效能
Qwen2.5-Omni 針對即時語音與影片聊天而設計,支援分塊輸入與即時輸出。它在多種模態上展現出強勁表現,常常與同等規模的單模態模型相媲美。
多模態整合
在需要整合多種模態的任務上,Qwen2.5‑Omni 在 OmniBench 基準上達到最先進的表現。
單模態效能
模型在多個專業領域展現高水準的能力:
- 音訊:在音訊能力上超越同等規模的 Qwen2‑Audio,並在語音辨識(Common Voice)、翻譯(CoVoST2)與音訊理解(MMAU)上取得優異成績。
- 視覺:在圖像推理(MMMU、MMStar)與影片理解(MVBench)上表現與 Qwen2.5‑VL‑7B 相當。
- 語音生成:在語音生成的穩健性與自然度上優於其他模型,評估依據包括 Seed‑tts‑eval 以及主觀自然度測試。
- 指令遵循:端到端語音指令遵循的效能與使用文字輸入時相當,相關基準包括 MMLU 與 GSM8K。
未來發展
Qwen 計畫進一步提升 Qwen2.5‑Omni 的語音指令遵循能力,並加強協同的音視覺理解。實驗室亦致力於整合更多模態,朝向完整的全能模型邁進。