fossasia/voxbento
Open Source AI powered Interpretation Platform https://voxbento.com
해결하는 문제
Voxbento는 실시간 이벤트를 위한 실시간 해석 플랫폼입니다. 전용 하드웨어 설치가 필요 없이 브라우저 기반 환경을 제공하여 동시에 해석하는 해석사들이 이벤트 영상을 모니터링하고, 매우 낮은 지연 시간으로 청중에게 번역된 오디오를 방송할 수 있습니다.
작동 방식
이 시스템은 MediaMTX를 통해 WebRTC, WHIP, WHEP 프로토콜을 결합하여 1초 미만의 지연 시간으로 오디오 스트리밍을 처리합니다. 해석사들은 Jitsi를 통해 회의장면을 브라우저 기반 인터페이스로 모니터링하고, 번역된 오디오를 스트리밍합니다. FastAPI 포털은 조정, 상태 및 인증을 관리합니다. 자동화 기능을 위해 '플로어봇'이 Jitsi 회의에 참여하여 ffmpeg에 오디오를 공급하고, Deepgram, OpenAI, Groq, Anthropic 또는 Gemini와 같은 제공업체를 사용하여 백그라운드에서 음성 인식 및 번역을 수행합니다.
대상 사용자
실시간 번역 및 오디오 방송을 위한 확장 가능하고 설치 없이 사용 가능한 솔루션을 필요로 하는 이벤트 기획자와 동시통역사들입니다.
주요 특징
- 설치 없이 사용 가능: 해석사와 청중 모두 브라우저에서 완전히 작동합니다.
- 낮은 지연 시간 오디오: WebRTC/WHIP/WHEP을 활용해 거의 즉각적인 오디오 전달이 가능합니다.
- 유연한 동기화: 기획자가 청취자 측 오디오 지연을 추가하여 번역된 오디오를 지연된 영상 스트림과 동기화할 수 있습니다.
- AI 통합: 여러 제3자 AI 제공업체 또는 로컬 NVIDIA Riva 모델을 통해 백그라운드 음성 인식 및 번역을 지원합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트