Qwen2.5-Omni 发布:用于实时交互的端到端多模态模型
Qwen 已宣布发布 Qwen2.5-Omni,这是一款旗舰级端到端多模态模型,旨在实现对文本、图像、音频和视频的全方位感知。该模型通过文本生成和自然语音合成实现实时流式响应,为多模态交互提供了一个凝聚的接口。
Thinker-Talker 架构
Qwen2.5-Omni 利用新颖的 "Thinker-Talker" 架构来实现无缝的多模态处理和生成。该架构将模型的功能角色分为两个主要组件:
- Thinker:作为中央处理单元,Thinker 是一个由音频和图像编码器支持的 Transformer decoder。它处理来自文本、音频和视频模态的输入,以生成高层表示和文本。
- Talker:作为输出机制,Talker 是一个双轨自回归 Transformer Decoder。它以流式方式接收来自 Thinker 的高维表示和文本,并流畅地输出离散语音 token。
由于 Talker 共享了来自 Thinker 的所有历史上下文信息,因此该系统作为一个单一的凝聚模型运行,允许进行端到端训练和推理。
Time-aligned Multimodal RoPE (TMRoPE)
为了使视频输入的的时间戳与音频同步,Qwen2.5-Omni 引入了 TMRoPE (Time-aligned Multimodal RoPE),这是一种专门为多模态同步设计的新颖位置嵌入。
能力与性能
Qwen2.5-Omni 旨在用于实时语音和视频聊天,支持分块输入和即时输出。它在多个模态上展示了强大的性能,通常可以与同等规模的单模态模型相媲美。
多模态集成
在需要集成多种模态的任务中,Qwen2.5-Omni 在 OmniBench 基准测试中达到了最先进的性能。
单模态性能
该模型在几个专业领域表现出极高的熟练度:
- 音频:它在音频能力方面优于同等规模的 Qwen2-Audio 模型,并在语音识别 (Common Voice)、翻译 (CoVoST2) 和音频理解 (MMAU) 方面表现出强劲的结果。
- 视觉:它在图像推理 (MMMU, MMStar) 和视频理解 (MVBench) 方面达到了与 Qwen2.5-VL-7B 相当的性能。
- 语音生成:通过 Seed-tts-eval 和主观自然度测试评估,该模型在语音生成方面展示了卓越的鲁棒性和自然度。
- 指令遵循:端到端语音指令遵循性能可以与该模型使用文本输入时的有效性相媲美,正如 MMLU 和 GSM8K 等基准测试所证明的那样。
未来发展
Qwen 旨在进一步增强 Qwen2.5-Omni 遵循语音命令的能力,并改进协作式音视频理解。该实验室还旨在集成更多的模态,以更接近实现一个完全的 omni-model。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch