Qwen3.8-Omni-Flash 发布:支持 100 万 token 上下文的多模态智能体模型
TL;DR
Qwen3.8-Omni-Flash 是一款新型多模态语言模型,支持文本、图像、音频和视频输入,具备 100 万 token 的上下文窗口,可实现智能体式规划与工具调用,适用于真实世界的工作流,相比前代模型,音视频 API 价格降低超过 90%。
核心技术突破
1. 100 万 token 上下文窗口 – 该模型可处理高达一百万 token 的多模态数据,同时保持与同规模纯文本模型相当的文本性能。
2. 智能体式多模态推理 – Qwen3.8-Omni-Flash 可从用户问题出发,规划感知与工具使用步骤序列,并从长时音频-视频流中迭代获取证据。该智能体模式使 OmniVideoBench 的准确率从 63.4% 提升至 67.8%,同时将 token 消耗减少约 45.7%。
3. 成本降低 – 相较于 Qwen3.5-Omni-Plus,音频输入的每小时价格下降超过 98%,音视频输入下降超过 93%,基于标准化的 720p @ 1 fps 定价方法。
4. 扩展性提升 – 在 29 项基准测试中,该模型的平均得分较 Qwen3.5-Omni-Plus 提升超过 25%,尤其在 WildClawBench‑MM(+36.5 分)和 AgenticVBench(+22.3 分)上表现突出。音视频性能已接近或超越 Gemini 3.8 Flash。
基准测试亮点
| 基准测试 | Qwen3.8‑Omni‑Flash | Qwen3.5‑Omni‑Plus | Gemini 3.8 Flash |
|---|---|---|---|
| WildClawBench‑MM(多模态工具使用) | 71.0 | 34.5 | 58.9 |
| UniClawBench(多模态工具使用) | 69.6 | 67.1 | 69.0 |
| AgenticVBench(多模态工具使用) | 36.8 | 14.5 | 45.0 |
| OmniVideoBench(音视频推理) – 静态 | 63.4 | 53.8 | 65.2 |
| OmniVideoBench – 智能体模式 | 67.8 | 53.8 | 65.2 |
| OmniCap‑IF CSR | 80.6(↑8.5) | 72.1 | 81.9 |
| OmniCap‑IF ISR | 28.2(↑14.1) | 14.1 | 28.3 |
| AliMeeting DER / cpWER | **3.4 | 17.2**(从 88.1 | 89.6 下降) |
加粗分数为所列系统中的最佳成绩。括号内为相较于 Qwen3.5‑Omni‑Plus 的提升。
新增智能体能力
可控音视频字幕生成
该模型可根据用户指定的主题、时间范围、细节层级和输出格式生成视频字幕。支持从高层概览到灯光、镜头、音效设计等细粒度分析的多种应用场景。
长时音视频理解
对于数小时的录制内容,智能体不会处理整个流。而是采用粗粒度到细粒度的证据收集策略,将计算资源聚焦于回答问题的关键片段。在 token 使用量减少近一半的同时,准确率得到提升。
会议智能分析
Qwen3.8-Omni-Flash 可联合对音频与视频中的说话人进行区分,转录内容,对齐身份,并生成会议纪要、待办事项和风险分析。通过集成工具调用,智能体可基于会议结果发送跟进邮件、创建任务,甚至启动编码工作。
研究辅助视频探索
当用户问题超出视频内容范围时,模型可检索互补的多模态资源(图像、文档、其他视频),并生成图文并茂的研究报告,例如解释 Photoshop 混合模式的细微差别。
端到端音视频制作
该模型支持完整的制作流程,如音乐视频创作、短剧本地化和长篇电影评论。用户只需提供一个高层次指令,智能体即可规划、调用创意工具并交付成品视频。
生态系统扩展
Qwen‑MM‑Plugins – 一套插件套件,为长时音视频内容添加感知、工具使用和工作流执行能力。包含:
omni-chatcut:用于音乐视频生成omni-video2note:将教程转换为 PDF 笔记omni-skill-creator:从演示中提取可复用的标准操作流程(SOP)omni-memory:构建跨会话的持久化音视频记忆
Qwen‑Live Harness – 一个开源运行时,将实时 API(qwen3.8-omni-flash-realtime)连接至智能体框架,支持连续音视频流处理、内存管理及主动任务委派。
实时交互(Qwen3.8‑Omni‑Flash‑Realtime)
实时版本以约 85 tokens/s 的速度处理实时音视频流,文本与音频的首 token 延迟均低于 1 秒。支持:
- 口语练习 – 将非标准口音对齐至标准发音,同时保留节奏与情感。
- 空间音频感知 – 利用视觉上下文定位三维空间中的声源,支持“过来这里”等指令。
- 动态知识注入 – 技能可即时加载品牌语言、业务规则或领域知识,使单一模型可承担多种角色。
API 使用亮点
- 支持 OpenAI 兼容的聊天补全接口。
reasoning_effort参数(xhigh、medium、low)控制推理深度与成本之间的权衡。preserve_thinking默认启用,以提供透明的思维链输出。- 示例 Python 代码片段展示了混合模态输入(图像 + 音频 + 文本)与流式响应的使用方式。
对 AI 驱动生产力的影响
Qwen3.8-Omni-Flash 将多模态模型从被动感知推进至自主任务执行。通过整合长时音视频推理、智能体规划与低成本 API,它开启了全新类别的应用:
- 完全自动化的视频编辑与本地化流水线。
- 实时会议助手,不仅能总结,还能执行决策。
- 知识工作者可通过单个提示查询数小时多媒体内容,并获得简洁、可操作的输出。
- 模型驱动的研发循环,大型模型可迭代优化小型专用模型,如在四川方言语音识别任务中实现 40% 的相对 CER 降低。
快速上手
- 从通义千问 AI 平台获取 API 密钥。
- 使用 OpenAI 兼容端点,模型名称为
qwen3.8-omni-flash(实时流使用qwen3.8-omni-flash-realtime)。 - 通过提供的安装脚本安装 Qwen‑MM‑Plugins 套件,以启用感知与工具使用功能。
- 对于实时应用,安装
websocket-client、pyaudio和opencv-python,并参考示例 WebSocket 客户端代码。
引用
@misc{qwen38omniflash,
title = {Qwen3.8-Omni-Flash: Omni Senses. Agentic Delivery.},
url = {https://qwen.ai/blog?id=qwen3.8-omni-flash},
author = {{Qwen Team}},
month = {September},
year = {2026}
}