Qwen3.8-Omni-Flash 发布:支持 100 万 token 上下文的多模态智能体模型

TL;DR

Qwen3.8-Omni-Flash 是一款新型多模态语言模型,支持文本、图像、音频和视频输入,具备 100 万 token 的上下文窗口,可实现智能体式规划与工具调用,适用于真实世界的工作流,相比前代模型,音视频 API 价格降低超过 90%。


核心技术突破

1. 100 万 token 上下文窗口 – 该模型可处理高达一百万 token 的多模态数据,同时保持与同规模纯文本模型相当的文本性能。

2. 智能体式多模态推理 – Qwen3.8-Omni-Flash 可从用户问题出发,规划感知与工具使用步骤序列,并从长时音频-视频流中迭代获取证据。该智能体模式使 OmniVideoBench 的准确率从 63.4% 提升至 67.8%,同时将 token 消耗减少约 45.7%。

3. 成本降低 – 相较于 Qwen3.5-Omni-Plus,音频输入的每小时价格下降超过 98%,音视频输入下降超过 93%,基于标准化的 720p @ 1 fps 定价方法。

4. 扩展性提升 – 在 29 项基准测试中,该模型的平均得分较 Qwen3.5-Omni-Plus 提升超过 25%,尤其在 WildClawBench‑MM(+36.5 分)和 AgenticVBench(+22.3 分)上表现突出。音视频性能已接近或超越 Gemini 3.8 Flash。


基准测试亮点

基准测试 Qwen3.8‑Omni‑Flash Qwen3.5‑Omni‑Plus Gemini 3.8 Flash
WildClawBench‑MM(多模态工具使用) 71.0 34.5 58.9
UniClawBench(多模态工具使用) 69.6 67.1 69.0
AgenticVBench(多模态工具使用) 36.8 14.5 45.0
OmniVideoBench(音视频推理) – 静态 63.4 53.8 65.2
OmniVideoBench – 智能体模式 67.8 53.8 65.2
OmniCap‑IF CSR 80.6(↑8.5) 72.1 81.9
OmniCap‑IF ISR 28.2(↑14.1) 14.1 28.3
AliMeeting DER / cpWER **3.4 17.2**(从 88.1 89.6 下降)

加粗分数为所列系统中的最佳成绩。括号内为相较于 Qwen3.5‑Omni‑Plus 的提升。


新增智能体能力

可控音视频字幕生成

该模型可根据用户指定的主题、时间范围、细节层级和输出格式生成视频字幕。支持从高层概览到灯光、镜头、音效设计等细粒度分析的多种应用场景。

长时音视频理解

对于数小时的录制内容,智能体不会处理整个流。而是采用粗粒度到细粒度的证据收集策略,将计算资源聚焦于回答问题的关键片段。在 token 使用量减少近一半的同时,准确率得到提升。

会议智能分析

Qwen3.8-Omni-Flash 可联合对音频与视频中的说话人进行区分,转录内容,对齐身份,并生成会议纪要、待办事项和风险分析。通过集成工具调用,智能体可基于会议结果发送跟进邮件、创建任务,甚至启动编码工作。

研究辅助视频探索

当用户问题超出视频内容范围时,模型可检索互补的多模态资源(图像、文档、其他视频),并生成图文并茂的研究报告,例如解释 Photoshop 混合模式的细微差别。

端到端音视频制作

该模型支持完整的制作流程,如音乐视频创作、短剧本地化和长篇电影评论。用户只需提供一个高层次指令,智能体即可规划、调用创意工具并交付成品视频。


生态系统扩展

Qwen‑MM‑Plugins – 一套插件套件,为长时音视频内容添加感知、工具使用和工作流执行能力。包含:

  • omni-chatcut:用于音乐视频生成
  • omni-video2note:将教程转换为 PDF 笔记
  • omni-skill-creator:从演示中提取可复用的标准操作流程(SOP)
  • omni-memory:构建跨会话的持久化音视频记忆

Qwen‑Live Harness – 一个开源运行时,将实时 API(qwen3.8-omni-flash-realtime)连接至智能体框架,支持连续音视频流处理、内存管理及主动任务委派。


实时交互(Qwen3.8‑Omni‑Flash‑Realtime)

实时版本以约 85 tokens/s 的速度处理实时音视频流,文本与音频的首 token 延迟均低于 1 秒。支持:

  • 口语练习 – 将非标准口音对齐至标准发音,同时保留节奏与情感。
  • 空间音频感知 – 利用视觉上下文定位三维空间中的声源,支持“过来这里”等指令。
  • 动态知识注入 – 技能可即时加载品牌语言、业务规则或领域知识,使单一模型可承担多种角色。

API 使用亮点

  • 支持 OpenAI 兼容的聊天补全接口。
  • reasoning_effort 参数(xhighmediumlow)控制推理深度与成本之间的权衡。
  • preserve_thinking 默认启用,以提供透明的思维链输出。
  • 示例 Python 代码片段展示了混合模态输入(图像 + 音频 + 文本)与流式响应的使用方式。

对 AI 驱动生产力的影响

Qwen3.8-Omni-Flash 将多模态模型从被动感知推进至自主任务执行。通过整合长时音视频推理、智能体规划与低成本 API,它开启了全新类别的应用:

  • 完全自动化的视频编辑与本地化流水线。
  • 实时会议助手,不仅能总结,还能执行决策。
  • 知识工作者可通过单个提示查询数小时多媒体内容,并获得简洁、可操作的输出。
  • 模型驱动的研发循环,大型模型可迭代优化小型专用模型,如在四川方言语音识别任务中实现 40% 的相对 CER 降低。

快速上手

  1. 从通义千问 AI 平台获取 API 密钥。
  2. 使用 OpenAI 兼容端点,模型名称为 qwen3.8-omni-flash(实时流使用 qwen3.8-omni-flash-realtime)。
  3. 通过提供的安装脚本安装 Qwen‑MM‑Plugins 套件,以启用感知与工具使用功能。
  4. 对于实时应用,安装 websocket-clientpyaudioopencv-python,并参考示例 WebSocket 客户端代码。

引用

@misc{qwen38omniflash,
  title = {Qwen3.8-Omni-Flash: Omni Senses. Agentic Delivery.},
  url = {https://qwen.ai/blog?id=qwen3.8-omni-flash},
  author = {{Qwen Team}},
  month = {September},
  year = {2026}
}

Sources