izwi-ai/izwi

Voice AI runtime. Local first transcription, speaker diarization, TTS, and voice cloning with an OpenAI compatible API.

해결하는 문제

Izwi는 클라우드 서비스나 API 키 없이도 로컬 우선의 음성 AI 환경을 제공합니다. 사용자는 음성 인식(ASR), 음성 합성(TTS), 채팅 모델을 완전히 자신의 하드웨어에서 로컬로 실행하여 데이터 프라이버시를 보장할 수 있습니다.

작동 방식

데스크톱 앱, 웹 UI, CLI, 로컬 추론 서버로 작동합니다. ASR(자동 음성 인식), TTS(텍스트-to-음성), LLM 채팅용 다양한 모델 패밀리의 다운로드 및 실행을 관리합니다. 시스템은 OpenAI 호환 API 경로를 노출하여 다른 애플리케이션이 로컬 추론 기능을 사용할 수 있도록 합니다.

대상 사용자

사용자들이 음성 작업(예: 녹음, 음성 클로닝, 실시간 음성 대화)을 로컬에서 수행하여 프라이버시를 보호하거나 오프라인 접근을 원하는 경우에 적합합니다.

주요 특징

  • 포괄적인 오디오 툴킷: 실시간 음성 대화, 장시간 스튜디오 프로젝트, 화자 분리, 강제 정렬 지원.
  • 로컬 우선의 프라이버시: 추론 데이터는 로컬 머신에 머무르며, 클라우드 연결이 필요 없습니다.
  • OpenAI 호환성: 채팅 완료 및 오디오 작업용 /v1 API 경로 제공.
  • 광범위한 모델 지원: Qwen3, Whisper, Kokoro, Gemma 등 다양한 모델 패밀리 통합.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트