bytedance/SALMONN

SALMONN family: A suite of advanced multi-modal LLMs

何を解決するか

SALMONN は、LLM に汎用的な聴覚能力と高度な音声・視覚認識を提供するマルチモーダル大規模言語モデルのファミリーです。従来の LLM の限界を克服し、音声、会話、動画コンテンツを統合的に理解・推論できるようにします。

仕組み

同じファミリー内の専門化されたモデルのスイートを提供しており、それぞれ異なるマルチモーダル機能に焦点を当てています。

  • SALMONN: 汎用的な聴覚能力に焦点を当てたベースモデル。
  • video-SALMONN (1 & 2): 高品質な動画キャプション生成と動画質問応答(QA)が可能な音声・視覚 LLM。
  • ELLSA: ストリーミングフルデュプレックスフレームワーク内で視覚、音声、テキスト、行動を統合するエンドツーエンドモデル。同時生成と認識が可能。
  • 音声品質評価: 自然言語推論を用いた音声品質評価に特化したバージョン。

対象ユーザー

マルチモーダルAI、音声・視覚理解、エンドツーエンドの認識-行動システムに取り組む研究者および開発者。

主な特徴

  • マルチモーダル統合: 音声、会話、動画、テキストを統合。
  • 多様なモデルバリアント: 一般聴覚、動画キャプション、ストリーミングフルデュプレックスインタラクションに対応するモデルを含む。
  • 包括的なデータ: 3段階のトレーニングに必要なアノテーションを提供。SQA/AQAデータや音声ベースの物語作りデータを含む。
  • オープンソース: モデルチェックポイント、推論コード、QualiSpeechなどの専用データセットをリリース。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト