kadirnar/whisper-plus
WhisperPlus: Faster, Smarter, and More Capable 🚀
해결하는 문제
WhisperPlus는 음성 및 동영상 처리를 위한 종합적인 툴킷입니다. 음성을 텍스트로 변환하는 과정을 간소화하고, 생성된 트랜스크립트를 요약하며, RAG(Retrieval-Augmented Generation)를 사용해 동영상 콘텐츠와 상호작용할 수 있도록 하며, 동시에 화자 다이어라이제이션 및 텍스트에서 음성으로 변환(TTS)을 위한 도구도 제공합니다.
작동 방식
이 라이브러리는 기존 AI 모델을 래핑하는 전용 파이프라인 세트를 제공합니다. Hugging Face 모델(Whisper, BART 등), Mac에서 최적화된 Apple MLX, 그리고 Pyannote와 같은 다른 프레임워크와 통합됩니다. 또한 YouTube에서 오디오/비디오를 다운로드하는 유틸리티 함수와 LLM을 사용해 동영상 트랜스크립트와 '대화'할 수 있는 RAG 시스템도 포함되어 있습니다.
대상 사용자
복잡한 파이프라인을 처음부터 구축하지 않고도 음성 인식, 오디오 요약, 동영상 기반 Q&A 시스템을 구현하고자 하는 개발자 및 연구자에게 적합합니다.
주요 특징
- 다중 플랫폼 최적화: Apple MLX 및 Lightning Whisper를 지원하여 Mac에서 효율적인 실행을 가능하게 합니다.
- 고급 ASR: 양자화(Hqq, BitsAndBytes) 및 Flash Attention 2를 지원해 더 빠른 추론을 제공합니다.
- 완전한 파이프라인 지원: YouTube 다운로드부터 트랜스크립트, 화자 다이어라이제이션, 자동 자막 생성까지 전 과정을 커버합니다.
- 통합된 RAG: LanceDB 또는 AutoLLM을 사용해 동영상 콘텐츠와 대화할 수 있는 내장 기능을 제공합니다.
- 추가 모달리티: 텍스트에서 음성으로 변환(TTS) 및 텍스트 요약 파이프라인을 포함합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트