ZebangCheng/Emotion-LLaMA

Emotion-LLaMA: Multimodal Emotion Recognition and Reasoning with Instruction Tuning

해결하는 문제

Emotion-LLaMA는 본질적으로 다중 모달인 복잡한 현실 세계의 감정 표현을 포착하는 데 어려움을 해결합니다. 기존의 단일 모달 접근 방식은 미묘한 신호를 놓치는 경우가 많으며, 기존의 다중 모달 대규모 언어 모델(MLLM)은 음성 데이터 통합이나 세밀한 얼굴 미세표정 인식에 자주 어려움을 겪습니다.

작동 방식

이 프로젝트는 감정에 특화된 인코더(HuBERT: 음성용, EVA: 전반적 시각 특징용, MAE: 국소적 시각 특징용, VideoMAE: 시간적 특징용)를 사용하여 음성, 시각, 텍스트 입력을 통합합니다. 이러한 특징들은 공유 공간으로 정렬된 후, 인스트럭션 튜닝이 적용된 수정된 LLaMA 모델에 입력됩니다. 이를 지원하기 위해 연구자들은 다양한 상황에서 거시적 및 미시적 감정 레이블을 제공하는 MERR 데이터셋을 도입했습니다.

대상 사용자

정확한 감정 인식과 추론이 필요한 인간-컴퓨터 상호작용, 교육, 상담 응용 분야에서 일하는 연구자 및 개발자.

주요 특징

  • 다중 모달 통합: 음성, 시각, 텍스트를 통합하여 감정 인식 정확도를 향상.
  • 인스트럭션 튜닝: 특화된 데이터셋(MERR)을 사용하여 인식 및 추론 능력을 강화.
  • 우수한 성능: MER2023 및 MER2024 챌린지에서 최고 점수를 기록하고, EMER 데이터셋에서 다른 MLLM을 능가했습니다.
  • 포괄적인 도구 세트: 로컬 데모, 배치 추론 기능, 상세한 API 가이드 포함.

관련

  • Dispatch
  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트