kizuna-ai-lab/sokuji

Real-time two-way speech translation for bilingual meetings — auto-detects the spoken language and translates both directions, cloud or fully offline on-device. Desktop (Windows · macOS · Linux) + browser extension (Chrome · Edge) for Zoom, Meet, Teams & any app.

Sokuji – 실시간 양방향 음성 번역

개요 – Sokuji는 이중 언어 회의에서 참가자가 자신의 모국어로 말하고 다른 언어의 즉시 번역을 듣거나(또는 읽을 수 있게 하는) 크로스 플랫폼 데스크톱 앱 및 브라우저 확장 프로그램입니다. WebAssembly/WebGPU로 컴파일된 온디바이스 모델을 사용하여 완전히 오프라인으로 실행하거나, OpenAI, Google Gemini, Palabra.ai, Soniox와 같은 클라우드 제공업체로 오디오를 전달할 수 있습니다.

중요성 – 실시간 음성 번역은 일반적으로 클라우드 API와 인터넷 연결이 필요하며, 이는 지연 시간, 비용 및 프라이버시 우려를 높입니다. Sokuji의 로컬 추론 모드는 이러한 장벽을 제거합니다: API 키 불필요, GPU 불필요, 데이터가 기기를 벗어나지 않으면서도 ASR, 번역 및 TTS 모델의 방대한 컬렉션을 통해 수십 가지 언어를 지원합니다.


핵심 기능

카테고리 상세
오디오 파이프라인 음성 인식 → 기계 번역 → 음성 합성, 모두 단일 스트림에서 처리. 양방향 번역 지원(어떤 화자가 어떤 언어를 사용하는지 자동 감지).
로컬 모델 44개의 ASR 모델(Whisper, Cohere Transcribe, Voxtral 포함), 75개의 번역 모델(Opus-MT, Qwen, TranslateGemma), 137개의 TTS 모델(Piper, Coqui, VITS 등).
클라우드 제공업체 OpenAI, Google Gemini, Palabra.ai, Kizuna AI, Doubao AST 2.0, Soniox, Zoom AI Services, 범용 OpenAI 호환 엔드포인트.
언어 음성 인식 99개 언어 이상, 번역 55개 언어 이상, TTS 53개 언어.
플랫폼 Windows, macOS(Intel & Apple Silicon), Linux(deb 패키지), Chrome/Edge/Brave 확장 프로그램.
프라이버시 로컬 추론 모드에서는 모든 것이 온디바이스에서 실행됩니다. 클라우드 모드는 중간 서버 없이 제공업체에 직접 연결됩니다.
오디오 기능 가상 마이크 출력, 실시간 노이즈 서프레션, 에코 캔슬링, 라이브 자막, 시스템 오디오 캡처.

작동 방식(고수준 흐름)

  1. 캡처 – 마이크(사용자의 목소리) 및/또는 시스템 오디오(다른 참가자).
  2. 모드 선택클라우드(오디오를 제공업체로 전송) 또는 로컬(WASM + WebGPU를 통해 브라우저/Electron에서 ASR/번역/TTS 실행).
  3. 처리 – ASR이 텍스트를 생성하고, 번역 모델이 변환하며, TTS 모델이 대상 언어의 음성을 합성합니다.
  4. 출력 – 합성된 오디오는 가상 마이크로 전송되어 Zoom, Teams, Meet, Discord 등이 번역된 목소리를 재생합니다. 자막은 화면에 표시하거나 공유할 수 있습니다.

시작하기

대상 설치 단계
데스크톱 앱 Releases 페이지에서 적절한 설치 파일을 다운로드(Windows .exe, macOS .pkg, Linux .deb). 설치 파일을 실행하고 Sokuji를 시작합니다.
브라우저 확장 프로그램 Chrome Web Store 또는 Microsoft Edge Add-ons에서 추가하거나, 개발자 모드에서 압축된 확장 프로그램을 로드합니다(README 참조).
소스에서 빌드 ```bash
git clone https://github.com/kizuna-ai-lab/sokuji.git
cd sokuji && npm install
npm run electron:dev # dev mode
npm run electron:build # production build

---
### 일반적인 사용 사례
1. Sokuji를 열고 *언어 A*(예: 일본어)와 *언어 B*(예: 영어)를 설정합니다.  
2. Zoom, Teams, Google Meet, Discord 등에서 회의를 시작합니다.  
3. 모국어로 말합니다. Sokuji는 언어를 감지하고 번역하며, 번역된 목소리를 회의에 스트리밍합니다.  
4. 다른 참가자는 사용자가 그들의 언어로 말하는 것처럼 듣고, 사용자는 그들의 발언이 자신의 언어로 번역되어 들립니다 – 모두 실시간으로.

---
### 라이선스 및 커뮤니티
- **라이선스:** AGPL-3.0(배포 시 소스 코드는 오픈으로 유지되어야 함).  
- **기여:** 가이드라인이 제공됩니다. 프로젝트는 풀 리퀘스트와 버그 보고를 환영합니다.  
- **지원:** GitHub Issues, 아이디어를 위한 Discussions, 그리고 Windows 빌드에 무료 코드 서명을 제공하는 스폰서(SignPath).

---
### 요약
Sokuji는 라이브 이중 언어 회의를 위한 즉시 사용 가능하고 프라이버시 우선 솔루션입니다. 온디바이스 음성 모델의 방대한 스위트를 사용하여 완전히 오프라인으로 실행하거나, 주요 클라우드 AI 서비스에 연결할 수 있습니다. 데스크톱 앱 또는 브라우저 확장 프로그램을 설치하고 두 언어를 선택한 후, Zoom, Teams, Meet, Discord 및 기타 많은 플랫폼에서의 실시간 번역, 자막 및 가상 마이크 라우팅을 도구에 맡기세요.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트