bytedance/SALMONN

SALMONN family: A suite of advanced multi-modal LLMs

解决的问题

SALMONN 是一系列多模态大语言模型,旨在为 LLM 提供通用听觉能力与先进的音视频感知能力。它克服了传统 LLM 的局限性,使模型能够以统一的方式理解并推理音频、语音和视频内容。

工作原理

该项目提供同一家族内的多种专用模型,每种模型专注于不同的多模态能力:

  • SALMONN:专注于通用听觉能力的基础模型。
  • video-SALMONN (1 & 2):能够生成高质量视频字幕并执行视频问答(QA)的音视频 LLM。
  • ELLSA:一种端到端模型,在流式全双工框架中统一视觉、语音、文本和动作,支持并发生成与感知。
  • 语音质量评估:专用于通过自然语言推理评估语音质量的版本。

适用人群

从事多模态 AI、音视频理解以及端到端感知-行动系统的研究人员和开发者。

主要亮点

  • 多模态融合:统一整合音频、语音、视频和文本。
  • 多样化的模型变体:包含通用听觉、视频字幕生成和流式全双工交互的模型。
  • 全面的数据支持:提供三阶段训练所需的标注数据,包括 SQA/AQA 数据和基于音频的故事创作数据。
  • 开源:发布模型检查点、推理代码以及 QualiSpeech 等专用数据集。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目