Qwen3.5-Omni 版本說明
TL;DR
Qwen 發佈了 Qwen3.5‑Omni,這是一代全新全模態大型語言模型,能原生處理文字、圖像、音訊與影片,支援 256k 令牌上下文,並加入多語言語音辨識(113 種語言)與合成(36 種語言),以及即時互動功能,如語意輪替、網路搜尋、函式呼叫、語音控制與語音克隆。
概述
Qwen3.5‑Omni 是 Qwen 全模態系列的最新迭代。它透過 在大量文字、視覺以及超過 1 億小時的音視訊資料上進行預訓練,擴展了先前 Qwen3‑Omni 的模態範圍。模型系列包含三種指令微調尺寸——Plus、Flash 與 Light——皆可接受最高 256 k 令牌 的上下文。Qwen3.5‑Omni 能在單次請求中處理 超過 10 小時的原始音訊 或 400 秒的 720p 影片(1 fps)。
架構
The Thinker‑Talker design from Qwen3‑Omni is retained and refined:
- Thinker 透過 Vision Encoder 接收視覺影格,並透過 AuT 模組接收音訊。音視訊串流以 TMRoPE 位置編碼交錯。Thinker 處理融合的全模態表示並產生文字輸出。
- Talker 消費 Thinker 的文字與多模態訊號以產生語音。語音令牌使用 RVQ(Residual Vector Quantization)編碼,取代較重的 DiT 區塊,從而實現高效串流。
- Thinker 與 Talker 均採用 Hybrid‑Attention Mixture‑of‑Experts (MoE) 層,該層在提升容量的同時,使推論成本保持可控。
- 透過 chunk‑wise streaming input 為 Thinker 提供即時互動,並使用 streaming Talker 以 ARIA(Adaptive Rate Interleave Alignment) 交錯文字與語音令牌。ARIA 動態對齊令牌速率,以消除遺漏、誤讀以及數字發音不穩定的問題。
多模態能力
| 能力 | 細節 |
|---|---|
| 模態 | 文字、圖像、原始音訊,以及音視訊串流(影片 + 音訊)。 |
| 上下文長度 | 最高 256 k 令牌(≈ 400 k 字元)。 |
| 音訊處理 | 處理超過 10 小時的連續音訊;支援 113 種語言/方言 的語音轉文字。 |
| 音視訊處理 | 接受 720p 影片(1 fps)最長 400 秒;可產生結構化、帶時間戳的字幕與劇本級描述。 |
| 語音生成 | 合成 36 種語言/方言 的語音;支援語音克隆以及音量、速度、情感的細緻控制。 |
| 長篇推理 | 256 k 的上下文使文件級分析、多輪對話與複雜工具使用無需截斷。 |
效能亮點
Qwen3.5‑Omni‑Plus(最大指令微調變體)在 215 項音訊與音視訊基準測試上取得 最先進的成果。以下為選取的數據(除非另有說明,數值越高越好):
- 音視訊理解 – 在一般音訊理解、推理、辨識、翻譯與對話上超過 Gemini‑3.1 Pro;在整體音視訊分數上與 Gemini‑3.1 Pro 相當。
- 音視訊字幕 – 產生可控且詳細的字幕,具自動分段、時間戳與角色關係描述。
- 語音合成穩定性 – 以詞錯誤率(WER)衡量,Qwen3.5‑Omni‑Plus 在公開的 20 種語言多語言 TTS 資料集上取得 12.62 % WER,優於 ElevenLabs(13.08 %)與 Gemini‑2.5 Pro(在不同指標上為 2.72 %)。
- 多語言語音辨識 – 在 8 項 ASR 基準測試與 156 種語言的語音轉文字任務中取得最高分。
- 視覺與文字 – 在視覺基準測試(如 VQA、OCR、空間推理)上,模型的表現與同尺寸的 Qwen3.5 純文字模型相當。
新互動功能(即時 API)
Qwen3.5‑Omni 新增了多項功能,使其適用於即時助理與對話代理人:
- 語意中斷 – 原生的輪替意圖偵測可防止意外的回應並過濾背景噪音。
- 網路搜尋與函式呼叫 – 模型能在對話中自主決定是否執行網路搜尋或呼叫外部函式。
- 端對端語音控制 – 使用者可發出語音指令,即時調整說話音量、速度或情感語調。
- 語音克隆 – 上傳短音訊樣本,模型將在後續回覆中使用該聲音。
- 系統提示自訂 – 開發者可修改系統提示,以改變對話風格或角色,無需重新訓練。
- ARIA 對齊 – 即使文字與語音令牌速率不同,也能確保串流語音的連貫性,顯著提升自然度。
新興能力:音視訊 Vibe Coding
在擴展實驗中,Qwen3.5‑Omni 展示了 直接根據音視訊指示撰寫程式碼 的能力。模型能解讀影片示範(例如 UI 互動),並產生相應的原始碼,作者將此現象稱為 Audio‑Visual Vibe Coding。此功能透過 Offline API 提供。
示範亮點
- 音視訊字幕 – 模型為 3 分鐘的野生動物紀錄片產生劇本式、帶時間戳的字幕,包含角色名稱、音效註解與場景轉換。
- 多語言語音互動 – 使用者說中文,模型以克隆的中文聲音回覆,隨後切換至英文並使用另一個克隆聲音,整個過程皆在同一會話中完成。
- 工具使用 – 在即時聊天中,模型決定執行網路搜尋以取得當前日期,取得結果後直接將其納入回答,無需明確提示。
可用性
Qwen3.5‑Omni 可透過兩個端點取得:
- Offline API – 適用於批次處理、大規模音視訊分析,以及 Audio‑Visual Vibe Coding 使用情境。
- Realtime API – 為低延遲語音助理優化,支援上述互動功能。
開發者可透過 Qwen Chat 介面、Hugging Face 或 ModelScope 取得模型(同時提供離線與即時示範)。部落格文章中包含離線與即時呼叫的範例程式碼。
影響
Qwen3.5‑Omni 代表了朝向 原生全模態 AGI 的具體一步,透過單一架構統合感知(視覺、音訊、影片)與生成(文字、語音、程式碼)。其大型上下文視窗與多語言語音能力擴大了應用範圍——從多語言媒體分析與字幕製作,到能理解並回應複雜音視訊訊號的即時虛擬助理。Audio‑Visual Vibe Coding 的出現顯示未來模型可能彌合示範與實作之間的鴻溝,減少許多領域對手動程式設計的需求。
引用
若您引用 Qwen3.5‑Omni,請使用以下引用格式:
@misc{qwen35omniblog,
title = {Qwen3.5-Omni: Scaling Up, Toward Native Omni-Modal AGI},
url = {https://qwen.ai/blog?id=qwen3.5-omni},
author = {Qwen Team},
month = {March},
year = {2026}
}