jasoncheng7115/jt-live-whisper

100% 全地端 AI 語音工具集:即時轉錄、即時翻譯、錄音檔批次處理、講者辨識、會議摘要,所有 AI 模型皆在自有設備上運行,資料不經過任何雲端服務。

해결하는 문제

jt-live-whisper는 클라우드 API 없이 완전히 로컬에서 실시간 음성 인식 및 번역을 수행하는 AI 툴킷을 제공합니다. 민감한 회의의 데이터 프라이버시를 보장하고 월간 구독료를 제거합니다. Zoom 통화, 유튜브 영상, 팟캐스트와 같은 실시간 오디오 이벤트에서 언어 장벽을 해결하며, 녹음된 회의를 수동으로 요약하는 번거로움을 해소합니다.

작동 방식

이 도구는 macOS에서는 ScreenCaptureKit, Windows에서는 WASAPI Loopback를 사용하여 시스템 오디오를 캡처하고, 로컬 AI 모델의 파이프라인을 통해 처리합니다.

  1. 음성 인식 (ASR): OpenAI의 Whisper (via whisper.cpp, faster-whisper, mlx-whisper), Moonshine (초저지연 영어용), Breeze-ASR-26 (대만 훙커언용) 사용.
  2. 번역: Ollama, LM Studio 등으로 로컬 LLM 사용, Meta의 NLLB 600M, Argos Translate를 통해 중국어, 영어, 일본어 간 오프라인 번역.
  3. 화자 분리: resemblyzerspectralcluster를 사용하여 음성 특징으로 서로 다른 화자를 식별.
  4. 요약: 로컬 LLM을 사용해 회의 요약 생성 및 음성 인식 오류 수정.

단일 머신 모드(로컬 CPU/GPU 사용) 또는 하이브리드 모드(로컬 머신에서 오디오 캡처, 원격 GPU 서버에서 AI 추론 처리)로 실행 가능.

대상 사용자

  • 실시간 자막이 필요한 다국어 온라인 회의(Zoom, Teams, Meet) 참석자.
  • 클라우드에 데이터를 업로드하지 않고 녹음된 오디오 파일을 사생활 보호 상태에서 음성 인식 및 요약하고 싶은 사용자.
  • 언어 학습자이거나 외국어 콘텐츠를 시청하면서 즉시 번역이 필요한 사람.
  • NVIDIA 또는 Apple Silicon 장비를 보유하고 있어 자체 컴퓨팅 자원을 AI 작업에 활용하고 싶은 사용자.

주요 특징

  • 100% 로컬 실행: 클라우드 API 키나 데이터 업로드 없이 작동.
  • 시스템 전체 오디오 캡처: 특정 앱에 국한되지 않고, 모든 소리 출력 소프트웨어와 호환.
  • 다국어 지원: 영어, 중국어, 일본어, 대만 훙커언에 특화된 지원.
  • 포괄적인 도구 세트: 실시간 자막, 오프라인 배치 처리, 화자 식별, AI 기반 회의 요약 포함.
  • 유연한 인터페이스: 터미널 기반 인터랙티브 메뉴, 완전한 WebUI, 반투명 부유형 자막 오버레이 제공.
  • 통합 기능: 실시간 자막을 Telegram, Slack, Discord 등 플랫폼으로 전달 가능.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트