bytedance/SALMONN

SALMONN family: A suite of advanced multi-modal LLMs

해결하는 문제

SALMONN은 일반적인 청취 능력과 고급 음성-시각 인식 기능을 제공하는 다모달 대규모 언어 모델의 가족입니다. 기존 LLM의 한계를 극복하여 음성, 음성, 비디오 콘텐츠를 통합적으로 이해하고 추론할 수 있도록 합니다.

작동 방식

동일한 가족 내에서 전문화된 모델의 세트를 제공하며, 각각 다른 다모달 기능에 초점을 맞춥니다:

  • SALMONN: 일반적인 청취 능력에 중점을 둔 기본 모델.
  • video-SALMONN (1 & 2): 고품질 비디오 캡션 생성 및 비디오 질의응답(QA)을 수행할 수 있는 음성-시각 LLM.
  • ELLSA: 스트리밍 풀디플렉스 프레임워크 내에서 시각, 음성, 텍스트, 행동을 통합하는 엔드투엔드 모델로, 동시 생성과 인식이 가능합니다.
  • 음성 품질 평가: 자연어 추론을 활용한 음성 품질 평가에 특화된 버전.

대상 사용자

다모달 AI, 음성-시각 이해, 엔드투엔드 인식-행동 시스템 개발에 종사하는 연구자 및 개발자.

주요 특징

  • 다모달 통합: 음성, 음성, 비디오, 텍스트를 통합합니다.
  • 다양한 모델 변형: 일반 청취, 비디오 캡션, 스트리밍 풀디플렉스 상호작용을 위한 모델 포함.
  • 포괄적인 데이터: 3단계 학습을 위한 애노테이션 제공, SQA/AQA 데이터 및 음성 기반 스토리텔링 포함.
  • 오픈소스: 모델 체크포인트, 추론 코드, QualiSpeech와 같은 전용 데이터셋을 공개합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트