QwenAudio/SenseVoice

Open-source SenseVoiceSmall model for Mandarin, Cantonese, English, Japanese, and Korean ASR, language ID, emotion recognition, and audio event detection.

해결하는 문제

SenseVoice는 여러 음성 이해 작업을 동시에 처리할 수 있도록 설계된 음성 기반 모델입니다. 다양한 언어에서 높은 정확도와 낮은 지연 시간의 음성 인식을 제공하면서도, 표준 ASR 시스템에서 자주 놓치는 비언어적 신호(감정, 환경 소리 등)도 포착합니다.

작동 방식

SenseVoice는 비자기 회귀형 엔드투엔드 프레임워크를 사용하여 낮은 지연 시간의 추론을 달성합니다. 공개된 SenseVoiceSmall 체크포인트는 자동 음성 인식(ASR), 말하는 언어 식별(LID), 음성 감정 인식(SER), 음성 이벤트 탐지(AED)를 지원합니다. FastAPI를 통해 Python 기반 서비스로 배포하거나, ONNX 또는 Libtorch로 내보내어 최적화된 성능을 얻을 수 있으며, llama.cpp/GGUF를 사용해 CPU/에지 장치에서 자체 실행 가능한 바이너리로도 실행 가능합니다.

대상 사용자

중국어(표준어, 광둥어), 영어, 일본어, 한국어를 지원하는 다국어 기능이 필요한 음성 기반 애플리케이션을 개발하거나 연구하는 개발자 및 연구자. 실시간으로 감정 상태나 특정 음성 이벤트(웃음, 기침 등)를 탐지해야 하는 경우에 적합합니다.

주요 특징

  • 다중 작업 가능: 하나의 모델로 ASR, 언어 식별, 감정 인식, 음성 이벤트 탐지를 수행합니다.
  • 고효율성: 비자기 회귀 아키텍처로 Whisper-Small 및 Whisper-Large보다 훨씬 빠르게 작동합니다.
  • 풍부한 전사: 일반적인 인간-컴퓨터 상호작용 이벤트(박수, 울음, 재채기 등)와 감정 톤을 탐지합니다.
  • 유연한 배포: GPU, CPU, 에지 장치에서 GGUF를 통해 배포 가능하며, 바이너리 버전은 Python 런타임이 필요하지 않습니다.
  • 파인튜닝 지원: 특정 비즈니스 시나리오나 긴 꼬리 샘플에 맞게 모델을 적응시키기 위한 스크립트와 전략을 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트