Qwen3-Omni-Flash-2025-12-01 发布说明

Qwen3-Omni-Flash-2025-12-01 是 Qwen3-Omni 原生多模态大模型的全面升级迭代。它能够无缝处理文本、图像、音频和视频输入,并通过实时流式响应生成同步的文本和自然流畅的语音输出。

增强的音视频交互与控制

Qwen3-Omni-Flash-2025-12-01 提升了多轮音视频对话的稳定性和连贯性,解决了在日常口语场景中常见的“智能下降”问题。模型通过更好地理解和执行音视频指令,提供了更自然的交互体验。

系统提示控制已加强,允许对模型行为进行完整的自定义。用户现在可以细致调节角色风格(如动漫风、酷炫或甜美)、口语语调偏好以及输出长度限制。

多语言能力与语音合成

模型确保了更可靠的多语言兼容性,解决了前版本中语言遵循不稳定的问题。它支持:

  • 基于文本的交互:119 种语言
  • 语音识别:19 种语言
  • 语音合成:10 种语言

语音合成已升级,消除了机械或迟缓的表达。通过增强对韵律的自适应控制,模型能够根据文本上下文智能地调整语调、停顿和语速,以模拟人类语音。

性能基准

Qwen3-Omni-Flash-2025-12-01 在所有模态上相较于 Qwen3-Omni-Flash 均表现出显著提升:

文本理解与生成

  • 逻辑推理:在 ZebraLogic 上提升 +5.6
  • 代码生成:在 LiveCodeBench-v6 上提升 +9.3, 在 MultiPL-E 上提升 +2.7
  • 写作质量:在 WritingBench 上提升 +2.2

语音理解与合成

  • 语音理解:VoiceBench 提升 (+3.2),在 Fleurs-zh 上的词错误率显著降低。
  • 语音合成:生成更高质量、类人声的语音,节奏和韵律得到改进,尤其在中文和多语言环境中表现突出。

视觉与视频理解

  • 图像理解:在视觉推理任务中取得提升,包括在 MMMU 上 +4.7、在 MMMU-Pro 上 +4.8、在 MathVision_full 上 +2.2。
  • 视频理解:视频语义理解提升 (+1.6 在 MLVU),以及实时对话中的音视频同步更紧密。

未来发展路线图

Qwen 团队计划在多个方向上推进模型,包括:

  • 多说话人 ASR(自动语音识别)
  • 视频 OCR
  • 音视频主动学习
  • 加强对基于代理的工作流和函数调用的支持

Sources