OpenMOSS/MOSS-Audio
An open-source model for understanding speech, environmental sounds, and music through captioning, question answering, and reasoning
해결하는 문제
MOSS-Audio는 복잡한 현실 세계의 음성 이해를 위한 통합 모델을 제공합니다. 단순한 음성 전사 이상의 기능을 수행하며, 음향적 신호를 인식하고, 화자와 감정을 식별하며, 환경 음을 해석하고, 시간적 음성 컨텍스트를 기반으로 다단계 추론을 수행합니다.
작동 방식
이 시스템은 세 가지 구성 요소로 이루어진 모듈식 아키텍처를 사용합니다:
- MOSS-Audio-Encoder: 원시 음성을 12.5 Hz의 시간적 표현으로 변환하는, 처음부터 훈련된 전용 인코더입니다.
- 모달리티 어댑터: 이러한 표현을 대규모 언어 모델(LLM)의 임베딩 공간으로 매핑합니다.
- LLM 백본: Qwen3(4B 또는 8B)를 사용하여 음성 특징 기반의 자기회귀적 텍스트를 생성합니다.
성능 향상을 위해 DeepStack Cross-Layer Feature Injection을 활용합니다. 이는 인코더의 여러 레이어(상위 레이어뿐만 아니라)의 특징을 LLM에 피드백하여 저수준 음향 정보(예: 음색, 리듬)를 유지합니다. 또한 사전 훈련 중에 타임마커 삽입을 사용하여 "무엇이 언제 일어났는지"를 추적할 수 있도록 하여 정확한 타임스탬프 부여와 이벤트 위치 추정이 가능합니다.
대상 사용자
타임스탬프가 포함된 음성-텍스트 변환, 음성 캡션, 환경 음 분석, 복잡한 음성 기반 질문 응답 등의 작업에 고성능 오픈소스 음성 모델이 필요한 개발자 및 연구자입니다.
주요 특징
- 통합 기능: 하나의 모델로 음성 이해, 음악 분석, 환경 음 감지, 음성 캡션을 모두 지원합니다.
- 추론 유형 다양성: 직접 지시를 따르는 "Instruct" 모델과 사고 과정(Chain-of-Thought) 추론을 수행하는 "Thinking" 모델을 모두 제공합니다.
- 높은 시간 정확도: 타임스탬프 기반 ASR 정확도에서 다른 오픈소스 모델과 일부 폐쇄소스 모델을 크게 능가합니다.
- 강력한 ASR 성능: 코드 스위칭, 방언, 비음성 발성 등 다양한 상황에서도 우수한 성능을 발휘합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트