ZebangCheng/Emotion-LLaMA

Emotion-LLaMA: Multimodal Emotion Recognition and Reasoning with Instruction Tuning

何を解決するか

Emotion-LLaMAは、本質的にマルチモーダルな複雑な現実世界の感情表現を捉えることの難しさに対処します。従来の単一モーダルアプローチは微細な手がかりを逃すことが多く、既存のマルチモーダル大規模言語モデル(MLLM)は音声データの統合や顔面の微細な筋肉の動き(マイクロエクスプレッション)の認識に頻繁に苦労しています。

どう動くか

このプロジェクトは、感情に特化したエンコーダー(音声用にHuBERT、グローバル視覚特徴用にEVA、局所視覚特徴用にMAE、時間的特徴用にVideoMAE)を用いて音声、視覚、テキスト入力を統合します。これらの特徴は共有空間にアライメントされ、インストラクションチューニングが施された修正版LLaMAモデルに供給されます。これを支えるために、著者らは多様な状況下で粗粒度および細粒度の感情ラベルを提供するMERRデータセットを導入しました。

対象ユーザー

正確な感情認識と推論が求められる人間-コンピュータインタラクション、教育、カウンセリングアプリケーションに取り組む研究者や開発者。

主な特徴

  • マルチモーダル統合: 音声、視覚、テキストを統合して感情認識の正確性を向上。
  • インストラクションチューニング: 特化したデータセット(MERR)を使用して認識および推論能力を強化。
  • SOTA性能: MER2023およびMER2024チャレンジでトップスコアを達成し、EMERデータセットでも他のMLLMを上回りました。
  • 包括的なツールキット: ローカルデモ、バッチ推論機能、詳細なAPIガイドを含みます。

関連

  • Dispatch
  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト