royshil/obs-localvocal
OBS plugin for local speech recognition and captioning using AI
해결하는 문제
LocalVocal은 실시간 음성-텍스트 변환 및 번역을 제공하는 OBS 플러그인입니다. 스트리머와 콘텐츠 크리에이터가 클라우드 서비스에 의존하지 않고 화면에 라이브 자막을 생성하거나 파일로 저장할 수 있도록 하여, 프라이버시를 보장하고 네트워크 지연이나 비용을 제거합니다.
작동 방식
이 플러그인은 CPU 및 GPU에서 효율적인 로컬 실행을 위해 Whisper.cpp를 통해 OpenAI의 Whisper 모델을 통합합니다. 번역에는 CTranslate2를 사용합니다. CUDA (NVIDIA), hipBLAS (AMD), Metal (Apple Silicon) 및 Vulkan을 포함한 광범위한 하드웨어 가속 백엔드를 지원하여, 고사양 GPU 없이도 다양한 하드웨어 구성에서 실행할 수 있습니다.
대상 사용자
오디오 스트림을 여러 언어로 실시간, 프라이빗하게 로컬에서 변환 및 번역해야 하는 OBS Studio 사용자들을 위해 설계되었습니다.
주요 특징
- 로컬 처리: 모든 데이터가 기기에 머물러 클라우드 비용, 네트워크 연결 또는 GPU가 필요하지 않습니다 (단, GPU 가속은 지원됩니다).
- 다국어 지원: 100개 언어의 오디오를 변환하고 자막을 실시간으로 번역합니다.
- 유연한 출력: 자막을 OBS 텍스트 소스로 표시하거나,.txt 또는.srt 파일로 저장하거나, RTMP 스트림을 통해 YouTube 및 Twitch와 같은 플랫폼으로 전송할 수 있습니다.
- 하드웨어 범용성: Windows, macOS 및 Linux 전반에 걸쳐 방대한 CPU 및 GPU 백엔드를 지원합니다.
- 사용자 정의 모델: 사용자는 내장된 Whisper 모델을 다운로드하거나 자체 GGML Whisper 모델 파일을 제공할 수 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트