ZebangCheng/Emotion-LLaMA

Emotion-LLaMA: Multimodal Emotion Recognition and Reasoning with Instruction Tuning

解決的問題

Emotion-LLaMA 解決了捕捉複雜、現實世界情感表達的困難,這些表達本質上是多模態的。傳統的單模態方法經常會遺漏細微線索,而現有的多模態大語言模型(MLLM)在整合音訊資料或識別細微的面部微表情方面經常遇到困難。

工作原理

該項目使用一組情感專用編碼器(HuBERT 用於音訊,EVA 用於全局視覺特徵,MAE 用於局部視覺特徵,VideoMAE 用於時間特徵)來整合音訊、視覺和文字輸入。這些特徵被對齊到一個共享空間,並輸入到經過指令微調的修改版 LLaMA 模型中。為支援此工作,作者引入了 MERR 資料集,該資料集在多種情境下提供了粗粒度與細粒度的情感標註。

適用對象

需要精確情感感知與推理能力的人機互動、教育和心理諮商應用領域的研究人員與開發者。

主要亮點

  • 多模態融合:結合音訊、視覺和文字,提升情感識別準確率。
  • 指令微調:使用專用資料集(MERR)增強識別與推理能力。
  • SOTA 性能:在 MER2023 和 MER2024 挑戰賽中取得最高分,並在 EMER 資料集上超越其他 MLLM。
  • 全面工具支援:包含本地示範、批次推論功能和詳細的 API 指南。

相關

  • Dispatch
  • 專案
  • 專案
  • Dispatch
  • 專案