Qwen3.8-Omni-Flash 發布:具備 1M Token 上下文的多模態代理模型

TL;DR

Qwen3.8-Omni-Flash 是一款全新的多模態語言模型,支援文字、影像、音訊與影片輸入,擁有 1 M token 的上下文視窗,能執行代理式規劃與工具使用,適用於真實世界的生產力工作流程,並相較於前代模型,將音訊與視訊 API 價格降低超過 90%。


核心技術進展

1. 1 M token 上下文視窗 – 該模型可處理最多一百萬個 token 的多模態資料,同時保持與同等規模純文字模型相當的文字表現。

2. 代理式多模態推理 – Qwen3.8-Omni-Flash 可從使用者提問出發,規劃一連串感知與工具使用步驟,並迭代地從長時間的音訊與視訊串流中蒐集證據。此代理模式使 OmniVideoBench 的準確率從 63.4 % 提升至 67.8 %,同時將 token 使用量減少約 45.7 %。

3. 成本降低 – 根據標準化的 720p @ 1 fps 定價方法,音訊輸入的每小時價格下降超過 98 %,音訊與視訊輸入下降超過 93 %,相較於 Qwen3.5-Omni-Plus。

4. 擴展效益 – 在 29 個基準測試中,模型的平均分數相較於 Qwen3.5-Omni-Plus 提升超過 25 %,尤其在 WildClawBench‑MM(+36.5 分)與 AgenticVBench(+22.3 分)上表現突出。音訊與視訊表現已接近或超越 Gemini 3.8 Flash。


基準測試亮點

基準測試 Qwen3.8‑Omni‑Flash Qwen3.5‑Omni‑Plus Gemini 3.8 Flash
WildClawBench‑MM(多模態工具使用) 71.0 34.5 58.9
UniClawBench(多模態工具使用) 69.6 67.1 69.0
AgenticVBench(多模態工具使用) 36.8 14.5 45.0
OmniVideoBench(音訊與視訊推理) – 靜態 63.4 53.8 65.2
OmniVideoBench – 代理模式 67.8 53.8 65.2
OmniCap‑IF CSR 80.6(↑8.5) 72.1 81.9
OmniCap‑IF ISR 28.2(↑14.1) 14.1 28.3
AliMeeting DER / cpWER **3.4 17.2**(由 88.1 89.6 下降)

粗體分數為所列系統中的最佳表現。括號內為相較於 Qwen3.5‑Omni‑Plus 的提升。


新增代理功能

可控音訊與視訊字幕生成

模型可根據使用者指定的主題、時間範圍、細節層級與輸出格式,生成精準的影片字幕。此功能適用於從高階概覽到照明、鏡頭運鏡與音效設計等細緻分析的各類應用。

長時段音訊與視訊理解

針對數小時的錄製內容,代理不會處理整個串流。相反地,它會執行由粗到細的證據蒐集,將運算資源聚焦於回答問題的關鍵片段。在準確率提升的同時,token 使用量幾乎減少一半。

會議智慧

Qwen3.8-Omni-Flash 可同時對音訊與視訊進行說話人辨識、內容轉錄、身分對齊,並能生成會議紀錄、行動項目與風險分析。整合的工具呼叫功能讓代理能根據會議結果自動發送追蹤郵件、建立任務,甚至啟動程式碼撰寫。

研究輔助影片探索

當使用者提出超出影片內容的問題時,模型可取得補充的多模態來源(影像、文件、其他影片),並產出富含圖示的研究報告,例如解釋 Photoshop 混合模式的細微差異。

端對端音訊與視訊製作

模型支援完整的製作流程,如音樂影片創作、短劇本地化與長篇電影評論。使用者僅需提供單一高階指令,代理便能規劃、呼叫創意工具,並交付完成的影片。


生態系統擴展

Qwen‑MM‑Plugins – 一套插件套件,為長時段音訊與視訊內容增添感知、工具使用與工作流程執行能力。包含:

  • omni-chatcut:用於音樂影片生成
  • omni-video2note:將教學影片轉換為 PDF 記錄
  • omni-skill-creator:從示範中提取可重複使用的標準作業程序(SOP)
  • omni-memory:跨會話建立持久的音訊與視訊記憶

Qwen‑Live Harness – 一個開源執行時環境,將即時 API(qwen3.8-omni-flash-realtime)與代理框架連接,處理連續的音訊與視訊串流、記憶管理與主動任務委派。


即時互動(Qwen3.8‑Omni‑Flash‑Realtime)

即時版本可每秒處理約 85 token 的即時音訊與視訊串流,文字與音訊的首 token 延遲均低於 1 秒。支援:

  • 口語練習 – 將非標準口音對齊至標準發音,同時保留語調與情感。
  • 空間音訊感知 – 利用視覺上下文定位三維空間中的聲源,支援「過來這裡」等指令。
  • 動態知識注入 – 技能可即時載入品牌語彙、商業規則或領域知識,使單一模型能承擔多重角色。

API 使用亮點

  • 支援 OpenAI 兼容的聊天補全。
  • reasoning_effort 參數(xhighmediumlow)控制推理深度與成本之間的平衡。
  • preserve_thinking 預設啟用,以提供透明的思考鏈輸出。
  • 範例 Python 程式碼示範混合模態輸入(影像 + 音訊 + 文字)與串流回應。

對 AI 驅動生產力的影響

Qwen3.8-Omni-Flash 將多模態模型從被動感知轉向自主任務執行。透過整合長時段音訊與視訊推理、代理式規劃與低成本 API,開啟了新類型應用的可能:

  • 完全自動化的影片編輯與本地化流程。
  • 即時會議助理,不僅能摘要,更能根據決策主動執行。
  • 知識工作者可僅用單一提示查詢數小時的多媒體內容,並獲得簡潔且可執行的輸出。
  • 模型驅動的研發循環,大型模型可迭代改進小型專精模型,如在四川方言語音辨識上實現 40 % 的相對 CER 降低。

開始使用

  1. 從 Qianwen AI 平台取得 API 金鑰。
  2. 使用 OpenAI 兼容端點,並指定模型名稱為 qwen3.8-omni-flash(即時串流則使用 qwen3.8-omni-flash-realtime)。
  3. 透過提供的安裝程式碼安裝 Qwen‑MM‑Plugins 套件,以啟用感知與工具使用功能。
  4. 若用於即時應用,請安裝 websocket-clientpyaudioopencv-python,並依照範例 WebSocket 客戶端程式碼操作。

引用

@misc{qwen38omniflash,
  title = {Qwen3.8-Omni-Flash: Omni Senses. Agentic Delivery.},
  url = {https://qwen.ai/blog?id=qwen3.8-omni-flash},
  author = {{Qwen Team}},
  month = {September},
  year = {2026}
}

Sources