OpenMOSS/MOSS-Audio

An open-source model for understanding speech, environmental sounds, and music through captioning, question answering, and reasoning

解决的问题

MOSS-Audio 提供了一个统一的模型,用于复杂现实世界中的音频理解。它超越了简单的语音转录,能够感知声学线索、识别说话人和情绪、解析环境声音,并对时间上的音频上下文进行多步推理。

工作原理

该系统采用由三部分组成的模块化架构:

  1. MOSS-Audio-Encoder:一个从零开始训练的专用编码器,将原始音频转换为 12.5 Hz 的时间表示。
  2. 模态适配器:将这些表示投影到大型语言模型(LLM)的嵌入空间中。
  3. LLM 主干:使用 Qwen3(4B 或 8B)基于音频特征生成自回归文本。

为提升性能,系统采用 DeepStack 跨层特征注入,将来自编码器多个层级(而不仅仅是顶层)的特征输入 LLM,以保留音色、节奏等低层声学细节。同时在预训练阶段使用 时间标记插入,帮助模型追踪“何时发生了什么”,从而实现精确的时间戳和事件定位。

适用人群

需要高性能、开源音频模型来完成语音转文字带时间戳、音频字幕生成、环境声音分析以及复杂音频问答等任务的开发者和研究人员。

主要亮点

  • 统一能力:一个模型即可支持语音理解、音乐分析、环境声音检测和音频字幕生成。
  • 推理模式多样:提供“指令”模型(直接遵循指令)和“思考”模型(链式思维推理)两种类型。
  • 高时间精度:在时间戳语音识别(ASR)准确率方面,显著优于其他开源模型,甚至部分闭源模型。
  • 鲁棒性强的 ASR:在多种复杂场景下表现优异,包括代码切换、方言、非语音发声等。

相关

  • 项目
  • 项目
  • 项目
  • 项目