Qwen3.8-Omni-Flash 發布:具備 1M Token 上下文的多模態代理模型
TL;DR
Qwen3.8-Omni-Flash 是一款全新的多模態語言模型,支援文字、影像、音訊與影片輸入,擁有 1 M token 的上下文視窗,能執行代理式規劃與工具使用,適用於真實世界的生產力工作流程,並相較於前代模型,將音訊與視訊 API 價格降低超過 90%。
核心技術進展
1. 1 M token 上下文視窗 – 該模型可處理最多一百萬個 token 的多模態資料,同時保持與同等規模純文字模型相當的文字表現。
2. 代理式多模態推理 – Qwen3.8-Omni-Flash 可從使用者提問出發,規劃一連串感知與工具使用步驟,並迭代地從長時間的音訊與視訊串流中蒐集證據。此代理模式使 OmniVideoBench 的準確率從 63.4 % 提升至 67.8 %,同時將 token 使用量減少約 45.7 %。
3. 成本降低 – 根據標準化的 720p @ 1 fps 定價方法,音訊輸入的每小時價格下降超過 98 %,音訊與視訊輸入下降超過 93 %,相較於 Qwen3.5-Omni-Plus。
4. 擴展效益 – 在 29 個基準測試中,模型的平均分數相較於 Qwen3.5-Omni-Plus 提升超過 25 %,尤其在 WildClawBench‑MM(+36.5 分)與 AgenticVBench(+22.3 分)上表現突出。音訊與視訊表現已接近或超越 Gemini 3.8 Flash。
基準測試亮點
| 基準測試 | Qwen3.8‑Omni‑Flash | Qwen3.5‑Omni‑Plus | Gemini 3.8 Flash |
|---|---|---|---|
| WildClawBench‑MM(多模態工具使用) | 71.0 | 34.5 | 58.9 |
| UniClawBench(多模態工具使用) | 69.6 | 67.1 | 69.0 |
| AgenticVBench(多模態工具使用) | 36.8 | 14.5 | 45.0 |
| OmniVideoBench(音訊與視訊推理) – 靜態 | 63.4 | 53.8 | 65.2 |
| OmniVideoBench – 代理模式 | 67.8 | 53.8 | 65.2 |
| OmniCap‑IF CSR | 80.6(↑8.5) | 72.1 | 81.9 |
| OmniCap‑IF ISR | 28.2(↑14.1) | 14.1 | 28.3 |
| AliMeeting DER / cpWER | **3.4 | 17.2**(由 88.1 | 89.6 下降) |
粗體分數為所列系統中的最佳表現。括號內為相較於 Qwen3.5‑Omni‑Plus 的提升。
新增代理功能
可控音訊與視訊字幕生成
模型可根據使用者指定的主題、時間範圍、細節層級與輸出格式,生成精準的影片字幕。此功能適用於從高階概覽到照明、鏡頭運鏡與音效設計等細緻分析的各類應用。
長時段音訊與視訊理解
針對數小時的錄製內容,代理不會處理整個串流。相反地,它會執行由粗到細的證據蒐集,將運算資源聚焦於回答問題的關鍵片段。在準確率提升的同時,token 使用量幾乎減少一半。
會議智慧
Qwen3.8-Omni-Flash 可同時對音訊與視訊進行說話人辨識、內容轉錄、身分對齊,並能生成會議紀錄、行動項目與風險分析。整合的工具呼叫功能讓代理能根據會議結果自動發送追蹤郵件、建立任務,甚至啟動程式碼撰寫。
研究輔助影片探索
當使用者提出超出影片內容的問題時,模型可取得補充的多模態來源(影像、文件、其他影片),並產出富含圖示的研究報告,例如解釋 Photoshop 混合模式的細微差異。
端對端音訊與視訊製作
模型支援完整的製作流程,如音樂影片創作、短劇本地化與長篇電影評論。使用者僅需提供單一高階指令,代理便能規劃、呼叫創意工具,並交付完成的影片。
生態系統擴展
Qwen‑MM‑Plugins – 一套插件套件,為長時段音訊與視訊內容增添感知、工具使用與工作流程執行能力。包含:
omni-chatcut:用於音樂影片生成omni-video2note:將教學影片轉換為 PDF 記錄omni-skill-creator:從示範中提取可重複使用的標準作業程序(SOP)omni-memory:跨會話建立持久的音訊與視訊記憶
Qwen‑Live Harness – 一個開源執行時環境,將即時 API(qwen3.8-omni-flash-realtime)與代理框架連接,處理連續的音訊與視訊串流、記憶管理與主動任務委派。
即時互動(Qwen3.8‑Omni‑Flash‑Realtime)
即時版本可每秒處理約 85 token 的即時音訊與視訊串流,文字與音訊的首 token 延遲均低於 1 秒。支援:
- 口語練習 – 將非標準口音對齊至標準發音,同時保留語調與情感。
- 空間音訊感知 – 利用視覺上下文定位三維空間中的聲源,支援「過來這裡」等指令。
- 動態知識注入 – 技能可即時載入品牌語彙、商業規則或領域知識,使單一模型能承擔多重角色。
API 使用亮點
- 支援 OpenAI 兼容的聊天補全。
reasoning_effort參數(xhigh、medium、low)控制推理深度與成本之間的平衡。preserve_thinking預設啟用,以提供透明的思考鏈輸出。- 範例 Python 程式碼示範混合模態輸入(影像 + 音訊 + 文字)與串流回應。
對 AI 驅動生產力的影響
Qwen3.8-Omni-Flash 將多模態模型從被動感知轉向自主任務執行。透過整合長時段音訊與視訊推理、代理式規劃與低成本 API,開啟了新類型應用的可能:
- 完全自動化的影片編輯與本地化流程。
- 即時會議助理,不僅能摘要,更能根據決策主動執行。
- 知識工作者可僅用單一提示查詢數小時的多媒體內容,並獲得簡潔且可執行的輸出。
- 模型驅動的研發循環,大型模型可迭代改進小型專精模型,如在四川方言語音辨識上實現 40 % 的相對 CER 降低。
開始使用
- 從 Qianwen AI 平台取得 API 金鑰。
- 使用 OpenAI 兼容端點,並指定模型名稱為
qwen3.8-omni-flash(即時串流則使用qwen3.8-omni-flash-realtime)。 - 透過提供的安裝程式碼安裝 Qwen‑MM‑Plugins 套件,以啟用感知與工具使用功能。
- 若用於即時應用,請安裝
websocket-client、pyaudio與opencv-python,並依照範例 WebSocket 客戶端程式碼操作。
引用
@misc{qwen38omniflash,
title = {Qwen3.8-Omni-Flash: Omni Senses. Agentic Delivery.},
url = {https://qwen.ai/blog?id=qwen3.8-omni-flash},
author = {{Qwen Team}},
month = {September},
year = {2026}
}