OpenMOSS/MOSS-Audio

An open-source model for understanding speech, environmental sounds, and music through captioning, question answering, and reasoning

解決的問題

MOSS-Audio 提供了一個統一的模型,用於複雜現實世界的音訊理解。它超越了簡單的語音轉錄,能夠感知聲學線索、識別說話人與情緒、解析環境聲音,並對時間上的音訊上下文進行多步推理。

工作原理

該系統採用由三部分組成的模組化架構:

  1. MOSS-Audio-Encoder:一個從零開始訓練的專用編碼器,將原始音訊轉換為 12.5 Hz 的時間表示。
  2. 模態適配器:將這些表示投影到大型語言模型(LLM)的嵌入空間中。
  3. LLM 主幹:使用 Qwen3(4B 或 8B)基於音訊特徵生成自回歸文字。

為提升性能,系統採用 DeepStack 跨層特徵注入,將來自編碼器多個層級(而不僅是頂層)的特徵輸入 LLM,以保留音色、節奏等低層聲學細節。同時在預訓練階段使用 時間標記插入,幫助模型追蹤「何時發生了什麼」,從而實現精確的時間戳與事件定位。

適用對象

需要高性能量子、開源音訊模型來完成語音轉文字帶時間戳、音訊字幕生成、環境聲音分析以及複雜音訊問答等任務的開發者與研究人員。

主要亮點

  • 統一能力:一個模型即可支援語音理解、音樂分析、環境聲音檢測與音訊字幕生成。
  • 推理模式多樣:提供「指令」模型(直接遵循指令)與「思考」模型(鏈式思維推理)兩種類型。
  • 高時間精確度:在時間戳語音辨識(ASR)準確率方面,顯著優於其他開源模型,甚至部分閉源模型。
  • 強健的 ASR:在多種複雜場景下表現優異,包括程式碼切換、方言、非語音發聲等。

相關

  • 專案
  • 專案
  • 專案
  • 專案