bytedance/SALMONN
SALMONN family: A suite of advanced multi-modal LLMs
解决的问题
SALMONN 是一系列多模态大语言模型,旨在为 LLM 提供通用听觉能力与先进的音视频感知能力。它克服了传统 LLM 的局限性,使模型能够以统一的方式理解并推理音频、语音和视频内容。
工作原理
该项目提供同一家族内的多种专用模型,每种模型专注于不同的多模态能力:
- SALMONN:专注于通用听觉能力的基础模型。
- video-SALMONN (1 & 2):能够生成高质量视频字幕并执行视频问答(QA)的音视频 LLM。
- ELLSA:一种端到端模型,在流式全双工框架中统一视觉、语音、文本和动作,支持并发生成与感知。
- 语音质量评估:专用于通过自然语言推理评估语音质量的版本。
适用人群
从事多模态 AI、音视频理解以及端到端感知-行动系统的研究人员和开发者。
主要亮点
- 多模态融合:统一整合音频、语音、视频和文本。
- 多样化的模型变体:包含通用听觉、视频字幕生成和流式全双工交互的模型。
- 全面的数据支持:提供三阶段训练所需的标注数据,包括 SQA/AQA 数据和基于音频的故事创作数据。
- 开源:发布模型检查点、推理代码以及 QualiSpeech 等专用数据集。
相关
- 项目
- 项目
- 项目
- 项目
- 项目