Qwen3.8-Omni-Flash 发布说明
Qwen3.8-Omni-Flash 是一款下一代原生全模态模型,旨在推动 AI 智能体从简单的内容理解向自主任务规划与执行转型。它支持文本、图像、音频和视频输入,具备 1M token 的上下文窗口,提供与 Gemini 3.8 Flash 相当的视听性能,且整体音频表现超越后者。
智能体视听理解
Qwen3.8-Omni-Flash 通过为长内容采用智能体工作流,超越了静态处理。模型不再线性处理整个视频,而是自主决定观看或收听哪些片段,通过多轮从粗到细的证据收集来定位关键信息。
在 OmniVideoBench 基准测试中,这种智能体方法将准确率从 63.4 提高到了 67.8,同时将 token 消耗量降低了约 45.7%(从每次查询 145,736 个 token 降至 79,117 个)。
关键长内容能力
- 可控字幕: 用户可以指定视频描述的主题、时间范围和详细程度,从而对镜头、灯光和声音进行结构化分析。
- 会议智能: 模型原生支持长达一小时的视听输入,端到端地执行说话人分割、身份对齐和内容转录,以生成会议纪要和待办事项。
- 深度研究: 模型可以将视频内容与基于网络的各种多模态搜索相结合,生成带插图的研究报告。
视听制作与编辑
该模型通过规划和调用工具来交付成品媒体资产,从而实现端到端的专业工作流:
- Music2MV: 分析歌曲节奏、情绪和人声来设计角色和场景,输出带有时间戳的逐行歌词,以便进行视觉对齐。
- 短剧翻译: 自动化实现说话人感知的对话识别、语音克隆、配音和音频混音,用于国际化本地化。
- 电影解说: 从长篇电影中提取关键情节来规划和制作解说视频,自动调整语速和音量,将原始对话与旁白交织在一起。
Qwen3.8-Omni-Flash-Realtime
针对低延迟交互,Qwen3.8-Omni-Flash-Realtime 变体通过 WebSocket 和 WebRTC 感知并响应实时视听流。
实时创新
- 空间音频感知: 模型可以将空间声音与视觉信息相结合,以确定声源的方向和距离,从而实现基于音频线索的机器人导航(例如“到这里来”)。
- 口语练习: 联合建模发音和语义,在实时纠正口音和语调偏差的同时保持自然的语调情感。
- 动态知识注入: 支持通过“技能”注入身份设置和业务规则,使模型能够针对客户服务等特定应用调整其角色。
模型优化与信息压缩
Qwen3.8-Omni-Flash 可用于优化较小的模型。在一项实验中,该模型被指派改进 Qwen2.5-Omni-3B 的四川话语音识别能力。通过自主诊断问题并构建针对性的训练数据,它在 12 小时内将字符错误率从 25.79% 降低到了 15.30%(相对降低了 40.7%)。
此外,该模型还为诸如 Video2Note(将视频教程转换为带有关键截图和分步说明的结构化 PDF 笔记)和 Omni Skill Creator(从演示视频中提取标准作业程序 SOP 并转换为可重用的 Skill.md 文件)等工具提供支持。
基准测试与性能
全模态智能
Qwen3.8-Omni-Flash 展示了强大的工具使用能力,在 WildClawBench-MM 上得分为 71.0,在 UniClawBench 上得分为 69.6,在这些特定指标上优于 Qwen3.5-Omni-Plus 和 Gemini 3.8 Flash。
文本与视觉
- 编码: 在 SWE-bench Pro 上得分为 63.3,优于 Claude-Opus-4.6 (Max) 的 53.4。
- 视觉: 在 AndroidWorld 移动端使用测试中得分为 87.1,显著高于 Claude-Opus-4.6 (Max) 的 62.0。
吞吐量与延迟
实时 API 性能显示,首字延迟 (TTFT) 在 591ms 到 981ms 之间,首个音频包延迟在 978ms 到 1350ms 之间,具体取决于输入时长和模态。
社区见解与成本分析
技术用户之间的讨论强调了 Qwen3.8-Omni-Flash 相较于竞争对手的显著成本优势。一位用户指出:
"如果性能相当... 输入/输出 ($) Gemini : 1.5 / 9.0 | Qwen 3.8: 0.15 / 0.47 这是一次巨大的成本削减。" — @handle
其他用户对 Qwen-Live Harness 存储库的可用性表示担忧,一些用户报告在发布后不久就出现了 404 错误,并质疑 Omni 模型是否会以开放权重形式发布。
技术实现
API 配置
该模型支持 reasoning_effort 设置(xhigh、medium、low),以平衡分析深度与成本及速度。它兼容 OpenAI Chat Completions 和 Responses API。
插件生态
Qwen-MM-Plugins 为智能体框架(包括 Claude Code 和 OpenClaw)提供了一套工具,用于处理图像读取、OCR、说话人日志记录,以及从视频创建 MV 或 PDF 笔记。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch