salute-developers/GigaAM

Foundational Model for Speech Recognition Tasks

해결하는 문제

GigaAM은 고성능 음성 처리를 위한 오픈소스 음성 모델의 패밀리입니다. 특히 러시아어와 카자흐어, 키르기스어, 우즈베크어와 같은 소수 언어에 대한 최첨단(SoTA) 음성 인식(ASR) 및 감정 인식의 필요성을 충족시킵니다.

작동 방식

220M에서 600M 파라미터까지 다양한 크기의 Conformer 기반 기초 모델을 사용하며, 최대 200만 시간의 음성 데이터(다국어 버전 기준)로 사전 훈련합니다. 시스템은 Connectionist Temporal Classification(CTC) 및 Recurrent Neural Network Transducer(RNNT)와 같은 다양한 디코딩 전략을 활용하여 오디오를 텍스트로 변환합니다. 또한, 음성 임베딩 추출을 위한 자기지도 학습(SSL) 백본과 감정 탐지에 특화된 모델도 지원합니다.

대상 사용자

음성-텍스트 변환 애플리케이션, 감정 분석, 다국어 오디오 처리에 종사하는 개발자 및 연구자. 특히 러시아어권 또는 소수 언어를 타겟으로 하는 분들에게 적합합니다.

주요 특징

  • 다국어 지원: 70개 이상의 언어로 사전 훈련되었으며, 러시아어, 카자흐어, 키르기스어, 우즈베크어에서 높은 성능을 발휘합니다.
  • 엔드투엔드 ASR: v3_e2e 모델을 포함하여 구두점 및 텍스트 정규화를 지원하며, Whisper-large-v3와의 직접 비교에서 우수한 성능을 보입니다.
  • 배포 유연성: ONNX 내보내기를 지원하여 GPU 추론 속도를 향상시키고, Triton Inference Server 및 TensorRT와의 통합이 가능합니다.
  • 다양한 작업 지원: 음성 임베딩 추출, 단어 수준 타임스탬프, 외부 음성 활동 탐지(VAD)를 통한 장문 전사가 가능합니다.
  • 세부 조정 가능: PyTorch Lightning을 사용하여 사용자 정의 데이터셋으로 모델을 세부 조정할 수 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트
  • Dispatch