OpenMOSS/MOSS-Audio

An open-source model for understanding speech, environmental sounds, and music through captioning, question answering, and reasoning

何を解決するか

MOSS-Audioは、複雑な現実世界の音声理解を統合的に処理するモデルを提供します。単なる音声認識を越えて、音響的手がかりを認識し、話者や感情を特定し、環境音を解釈し、時間的な音声コンテキスト上で複数ステップの推論を実行します。

動作方法

このシステムは、以下の3つの部分からなるモジュールアーキテクチャを使用しています:

  1. MOSS-Audio-Encoder:元から訓練された専用エンコーダで、生の音声を12.5 Hzの時間的表現に変換します。
  2. モダリティアダプタ:これらの表現を大規模言語モデル(LLM)の埋め込み空間にマッピングします。
  3. LLMバックボーン:Qwen3(4Bまたは8B)を使用して、音声特徴に基づいて自己回帰的なテキストを生成します。

パフォーマンス向上のため、DeepStack Cross-Layer Feature Injection を採用しています。これは、エンコーダの複数の層(上位層だけでなく)の特徴をLLMにフィードバックすることで、音色やリズムといった低レベルの音響的詳細を保持します。また、事前学習中にタイムマーカー挿入を実施し、「何がいつ起きたか」を追跡できるようにすることで、正確なタイムスタンプ付与とイベントの局所化を可能にしています。

対象ユーザー

タイムスタンプ付き音声認識、音声キャプション、環境音分析、複雑な音声ベースの質問応答などのタスクに高パフォーマンスなオープンソース音声モデルが必要な開発者や研究者。

特徴

  • 統合的機能:1つのモデルで音声理解、音楽分析、環境音検出、音声キャプションをサポート。
  • 推論モードの選択肢:直接指示に従う「Instruct」モデルと、思考の流れ(Chain-of-Thought)を用いる「Thinking」モデルの両方を提供。
  • 高い時間的精度:タイムスタンプ付きASR精度において、他のオープンソースモデルおよび一部のクローズドソースモデルを大きく上回る。
  • 頑健なASR:コードスイッチ、方言、非音声的な発声など、多様な状況でも強力な性能を発揮。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト