bytedance/SALMONN
SALMONN family: A suite of advanced multi-modal LLMs
解決的問題
SALMONN 是一組多模態大型語言模型,旨在為 LLM 提供通用聽覺能力與先進的音視覺感知能力。它克服了傳統 LLM 的限制,使模型能夠以統一的方式理解並推理音訊、語音與影片內容。
工作原理
本專案提供同一家族內的多種專用模型,每種模型專注於不同的多模態能力:
- SALMONN:專注於通用聽覺能力的基礎模型。
- video-SALMONN (1 & 2):能生成高品質影片字幕並執行影片問答(QA)的音視覺 LLM。
- ELLSA:一種端對端模型,在串流全雙工框架中統一視覺、語音、文字與動作,支援同步生成與感知。
- 語音品質評估:專用於透過自然語言推理評估語音品質的版本。
適用對象
從事多模態 AI、音視覺理解以及端對端感知-行動系統的研究人員與開發者。
主要亮點
- 多模態整合:統一整合音訊、語音、影片與文字。
- 多樣化的模型變體:包含通用聽覺、影片字幕生成與串流全雙工互動的模型。
- 全面的資料:提供三階段訓練所需的註解資料,包括 SQA/AQA 資料與基於音訊的故事創作資料。
- 開源:釋出模型檢查點、推論程式碼與 QualiSpeech 等專用資料集。
相關
- 專案
- 專案
- 專案
- 專案
- 專案