Qwen3.5-Omni 发布说明

TL;DR

Qwen 发布了 Qwen3.5‑Omni,这是新一代完全全模态的大型语言模型,能够原生处理文本、图像、音频和视频,支持 256k token 上下文,并新增多语言语音识别(113 种语言)和合成(36 种语言),以及实时交互功能,如语义轮转、网页搜索、函数调用、语音控制和语音克隆。


概述

Qwen3.5‑Omni 是 Qwen 全模态系列的最新迭代。它通过 在海量文本、视觉以及超过 1 亿小时的音视频数据上进行预训练,扩展了前代 Qwen3‑Omni 的模态范围。模型系列包括三种指令微调尺寸——Plus、Flash 和 Light——全部支持最高 256 k token 的上下文。Qwen3.5‑Omni 能在一次请求中摄取 超过 10 小时的原始音频400 秒的 720p 视频(1 fps)

架构

The Thinker‑Talker design from Qwen3‑Omni is retained and refined:

  • Thinker 通过 Vision Encoder 接收视觉帧,通过 AuT 模块接收音频。音视频流使用 TMRoPE 进行位置编码交错。Thinker 处理融合的全模态表示并生成文本输出。
  • Talker 消费 Thinker 的文本和多模态提示以生成语音。语音 token 使用 RVQ(残差向量量化)进行编码,而非更重的 DiT 块,从而实现高效流式传输。
  • Thinker 与 Talker 均采用 Hybrid‑Attention Mixture‑of‑Experts (MoE) 层,在提升容量的同时保持推理成本可控。
  • 实时交互通过 chunk‑wise streaming input 为 Thinker 提供输入,并使用 streaming Talker 结合 ARIA(Adaptive Rate Interleave Alignment) 将文本和语音 token 交错。ARIA 动态对齐 token 速率,消除遗漏、误读以及数字发音不稳定等问题。

多模态能力

能力 细节
模态 文本、图像、原始音频以及音视频流(视频 + 音频)。
上下文长度 最高 256 k token(≈ 400 k 字符)。
音频处理 处理 > 10 h 的连续音频;支持 113 种语言/方言 的语音转文本。
音视频处理 接受 720p、1 fps 的视频,最长 400 秒;可生成结构化、带时间戳的字幕以及剧本级别的描述。
语音生成 36 种语言/方言 合成语音;支持语音克隆以及音量、速度、情感的细粒度控制。
长文本推理 256 k 的上下文使得文档级分析、多轮对话以及复杂工具使用无需截断。

性能亮点

Qwen3.5‑Omni‑Plus(最大规模的指令微调变体)在 215 项音频和音视频基准上取得 最先进的结果。以下为精选数据(除非另有说明,数值越高越好):

  • 音视频理解 – 在通用音频理解、推理、识别、翻译和对话方面超越 Gemini‑3.1 Pro;在整体音视频得分上与 Gemini‑3.1 Pro 持平。
  • 音视频字幕 – 生成可控、详细的字幕,具备自动分段、时间戳以及角色关系描述。
  • 语音合成稳定性 – 通过词错误率(WER)衡量,Qwen3.5‑Omni‑Plus 在公开的 20 语言多语言 TTS 数据集上取得 12.62 % WER,优于 ElevenLabs(13.08 %)和 Gemini‑2.5 Pro(在另一指标上为 2.72 %)。
  • 多语言语音识别 – 在 8 项 ASR 基准和 156 项特定语言的语音转文本任务中获得最高分。
  • 视觉与文本 – 在视觉基准(如 VQA、OCR、空间推理)上,模型的表现与同尺寸的 Qwen3.5 纯文本模型相当。

新交互特性(实时 API)

Qwen3.5‑Omni 增加了多项功能,使其适用于实时助理和对话代理:

  1. 语义中断 – 原生的轮转意图检测可防止意外的返听并过滤背景噪音。
  2. 网页搜索与函数调用 – 模型能够在对话中自主决定是否进行网页搜索或调用外部函数。
  3. 端到端语音控制 – 用户可以通过语音指令即时调节说话音量、速度或情感语调。
  4. 语音克隆 – 上传短语音样本,模型将在后续回复中使用该声音。
  5. 系统提示自定义 – 开发者可修改系统提示,以改变对话风格或角色设定,无需重新训练。
  6. ARIA 对齐 – 即使文本和语音 token 速率不同,也能保证流式语音的连贯性,显著提升自然度。

新兴能力:音视频 Vibe 编码

在规模实验中,Qwen3.5‑Omni 展示了 直接从音视频指令编写代码 的能力。模型能够理解视频演示(例如 UI 交互),并生成相应的源代码,作者将此现象称为 Audio‑Visual Vibe Coding。该功能通过 Offline API 提供。

演示亮点

  • 音视频字幕 – 模型为一段 3 分钟的野生动物纪录片生成剧本式、带时间戳的字幕,包含角色名称、音效注释和场景切换。
  • 多语言语音交互 – 用户使用普通话发声,模型以克隆的普通话声音回复,然后在同一会话中切换到英语并使用另一克隆声音。
  • 工具使用 – 在实时聊天中,模型决定进行当前日期的网页搜索,获取结果并将其整合进答案,无需显式提示。

可用性

Qwen3.5‑Omni 可通过两个端点访问:

  • Offline API – 适用于批处理、大规模音视频分析以及 Audio‑Visual Vibe Coding 场景。
  • Realtime API – 为低延迟语音助理优化,支持上述交互特性。

开发者可通过 Qwen Chat 界面Hugging FaceModelScope 获取模型(提供离线和实时演示)。博客文章中包含离线和实时调用的示例代码。

含义

Qwen3.5‑Omni 通过在单一架构中统一感知(视觉、音频、视频)与生成(文本、语音、代码),标志着向 原生全模态 AGI 前进的具体一步。其大上下文窗口和多语言语音能力拓宽了应用范围——从多语言媒体分析与字幕生成到能够理解并响应复杂音视频线索的实时虚拟助理。Audio‑Visual Vibe Coding 的出现表明,未来模型可能弥合演示与实现之间的鸿沟,降低许多领域对手工编程的需求。

引用

如果在文献中引用 Qwen3.5‑Omni,请使用以下引用:

@misc{qwen35omniblog,
  title = {Qwen3.5-Omni: Scaling Up, Toward Native Omni-Modal AGI},
  url = {https://qwen.ai/blog?id=qwen3.5-omni},
  author = {Qwen Team},
  month = {March},
  year = {2026}
}

Sources