modelscope/FunASR

Open-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.

해결하는 문제

FunASR는 오프라인, 스트리밍, 에지 배포를 위한 산업용 음성 인식 툴킷으로, 고성능의 엔드투엔드 ASR(자동 음성 인식)을 제공하도록 설계되었습니다. 사용자가 트랜스크립션, 음성 활동 탐지(VAD), 문장 부호, 화자 다이어라이제이션에 특화된 모델을 자유롭게 조합할 수 있는 유연한 툴킷의 필요성을 충족시키며, 단일한 몰리식 모델에 의존하는 것이 아니라 목적에 맞는 최적의 모델을 선택할 수 있도록 합니다.

작동 방식

이 툴킷은 여러 전문 모델을 조율하는 AutoModel 파이프라인을 사용합니다. 예를 들어, 일반적인 프로덕션 파이프라인은 트랜스크립션 모델(예: Paraformer 또는 Fun-ASR-Nano)과 VAD 모델(fsmn-vad), 화자 식별 모델(cam++)을 결합합니다. GPU 가속(vLLM를 통해), OpenAI 호환 API 서버, 그리고 GGUF 형식을 사용한 고효율 CPU 및 에지 배포를 위한 C++ 런타임(llama.cpp 기반)을 지원합니다.

대상 사용자

음성 기반 애플리케이션, AI 에이전트, 산업용 음성 서비스를 개발하는 개발자 및 엔지니어를 위한 것입니다. 저지연, 고정확도(특히 중국어, 영어, 일본어)를 요구하는 환경에서 고급 GPU부터 에지 장치까지 다양한 하드웨어에 배포할 수 있는 능력이 필요합니다.

주요 특징

  • 고성능: Fun-ASR-Nano와 vLLM를 사용해 최대 340배 실시간 속도를 달성.
  • 다양한 모델 라이브러리: ASR, 감정 인식, 오디오 이벤트, 화자 다이어라이제이션에 특화된 모델을 포함.
  • 다중 플랫폼 배포: Python, Docker, 그리고 standalone C++ 바이너리(llama.cpp 기반)로 Windows, Linux, macOS 지원.
  • 광범위한 언어 지원: 31개 이상의 언어에 대한 체크포인트 제공. 특히 중국어 방언과 지역 사투리에 강점.
  • 에이전트 준비: Claude/Cursor용 MCP 서버, LangChain 및 Dify용 OpenAI 호환 엔드포인트 제공.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트