crosswk/SayIt
Open-source voice typing for Windows — a Wispr Flow / Superwhisper alternative. Press a shortcut, speak, and AI-polished text lands at your cursor. Local models, your own API keys, or a self-hosted backend.
What it solves
SayIt은 사용자가 어떤 애플리케이션에서도 텍스트를 받아쓰기할 수 있도록 하는 Windows용 음성 타이핑 도구입니다. 수동 타이핑의 느린 속도와 가공되지 않은 음성-텍스트 변환의 부정확성을 해결하기 위해, AI 기반의 클린업 기능을 통해 추임새를 제거하고 인식 오류를 수정하여 다듬어진 텍스트가 커서 위치에 직접 삽입되도록 합니다.
How it works
사용자는 단축키를 트리거하여 오디오를 녹음하며, 녹음된 오디오는 선택한 음성 엔진을 통해 처리됩니다. 시스템은 세 가지 작동 모드를 지원합니다: Local mode (사용자의 GPU에서 GGUF 모델 사용), Cloud API mode (Groq 또는 Doubao와 같은 제공업체에 직접 연결), 그리고 Server mode (자체 호스팅된 FastAPI 백엔드에 연결). 텍스트가 전사된 후에는 OpenAI-compatible endpoints를 사용하여 AI 클린업 단계를 거쳐 문법과 어조를 정제한 뒤, 활성 창에 타이핑됩니다.
Who it’s for
이 도구는 편집기, 채팅 앱, 브라우저를 포함한 다양한 소프트웨어에서 작성 속도와 생산성을 높이고 싶으면서도, 음성 처리 방식과 개인정보 보호 설정을 직접 제어하고 싶은 Windows 사용자들을 위해 설계되었습니다.
Highlights
- Voice typing anywhere: Windows의 어떤 애플리케이션에서도 창 전환 없이 텍스트를 직접 삽입합니다.
- Editable AI cleanup: 추임새를 제거하거나 아이디어를 형식화하기 위해 사용자 정의 가능한 프롬프트를 제공합니다.
- Context-aware writing: 주변 텍스트를 읽어 어조를 맞추거나 선택된 텍스트에 대한 편집 지침으로 활용할 수 있습니다.
- Flexible recognition: Local GGUF 모델, Cloud API, 그리고 자체 호스팅 서버를 지원합니다.
- Overlay feedback: 녹음 중 시각적인 파형과 선택 사항인 실시간 자막을 제공합니다.
- Per-app rules: 활성 애플리케이션에 따라 클린업 동작을 자동으로 전환합니다.
관련
- 프로젝트
OpenWhispr/openwhisprOpenWhispr is a cross‑platform desktop app that converts speech to text, provides live meeting transcription with speaker diarisation, and lets you talk to AI assistants (GPT‑5, Claude, Gemini, etc.) directly from your keyboard. It works offline with Whisper‑based models or via cloud services, stores notes locally (with optional cloud sync), and offers an API for programmatic use.
- 프로젝트
tover0314-w/opentypelessmacOS, Windows, Linux에서 사용 가능한 오픈소스 AI 음성 입력 도구로, 어떤 데스크톱 애플리케이션에서도 문맥 인식 음성 입력, AI 재작성, 원샷 음성 Q&A를 제공합니다.
- 프로젝트
theJayTea/WritingToolsWriting Tools는 Windows, Linux, macOS용 무료 오픈소스 데스크톱 앱으로, 키보드 단축키로 컴퓨터 어디서든 LLM을 호출할 수 있습니다. 문법 검토, 재작성, 톤 변경, 번역, 웹 페이지 또는 유튜브 자막 요약, 모델과의 대화가 가능합니다. Gemini, OpenAI, Anthropic 등 클라우드 API 또는 Ollama, llama.cpp, Apple-silicon MLX를 통해 로컬 모델을 실행할 수 있습니다. 텔레메트리 없이 API 키는 로컬에 저장되는 개인정보 중심 설계이며, GPL-v3 라이선스로 제공됩니다.
- 프로젝트
Quantatirsk/qwen3-asrQwen3‑ASR는 Qwen3‑ASR 모델(0.6 B 및 1.7 B)을 감싸는 자체 호스팅 음성-텍스트 서버입니다. GPU‑vLLM 백엔드 또는 CPU‑Rust 백엔드를 자동 선택하며, OpenAI 및 Alibaba 호환 HTTP/WebSocket API를 제공합니다. 화자 분리, VAD 기반 세그멘테이션, 배치 추론을 지원하며 Docker, 커스텀 GPU 이미지, 오프라인 tar볼로 배포 가능합니다. MIT 라이선스입니다.
- 프로젝트
mkiol/dsnoteSpeech Note는 Linux/Sailfish 데스크톱용 오프라인 앱으로, 음성 기반 노트 작성, 텍스트 읽기, 번역을 모두 로컬에서 수행할 수 있습니다. Coqui STT, Vosk, Whisper cpp, Faster Whisper, April‑ASR 등의 오픈소스 STT 엔진, eSpeak‑NG, Piper, RHVoice, Mimic 3 등 다양한 TTS 음성, 그리고 Bergamot 오프라인 번역기를 통합했습니다. 사용자는 내장 브라우저를 통해 모델 체크포인트를 다운로드하여 모든 처리를 디바이스에서 수행함으로써 개인정보를 보호할 수 있습니다. Flathub의 Flatpak으로 제공되며, 소스에서 빌드도 가능하며 GPL‑3.0 라이선스입니다.