ZebangCheng/Emotion-LLaMA
Emotion-LLaMA: Multimodal Emotion Recognition and Reasoning with Instruction Tuning
解决的问题
Emotion-LLaMA 解决了捕捉复杂、现实世界情感表达的困难,这些表达本质上是多模态的。传统的单模态方法常常会遗漏细微线索,而现有的多模态大语言模型(MLLM)在整合音频数据或识别细微的面部微表情方面经常遇到困难。
工作原理
该项目使用一组情感专用编码器(HuBERT 用于音频,EVA 用于全局视觉特征,MAE 用于局部视觉特征,VideoMAE 用于时间特征)来整合音频、视觉和文本输入。这些特征被对齐到一个共享空间,并输入到经过指令微调的修改版 LLaMA 模型中。为支持这一工作,作者引入了 MERR 数据集,该数据集在多种场景下提供了粗粒度和细粒度的情感标注。
适用人群
需要准确情感感知和推理能力的人机交互、教育和心理咨询应用领域的研究人员和开发者。
主要亮点
- 多模态融合:结合音频、视觉和文本,提升情感识别准确率。
- 指令微调:使用专用数据集(MERR)增强识别和推理能力。
- SOTA 性能:在 MER2023 和 MER2024 挑战赛中取得最高分,并在 EMER 数据集上超越其他 MLLM。
- 全面工具支持:包含本地演示、批量推理功能和详细的 API 指南。
相关
- Dispatch
- 项目
- 项目
- Dispatch
- 项目