crosswk/SayIt
Open-source voice typing for Windows — a Wispr Flow / Superwhisper alternative. Press a shortcut, speak, and AI-polished text lands at your cursor. Local models, your own API keys, or a self-hosted backend.
What it solves
SayItは、あらゆるアプリケーションにテキストを音声入力できるWindows用の音声入力ツールです。手動入力の遅い速度や、生の音声からテキストへの変換における不正確さを解決するために、AIによるクリーンアップ機能を提供し、フィラー(言い淀み)の削除や認識エラーの修正を行うことで、洗練されたテキストをカーソル位置に直接挿入することを可能にします。
How it works
ユーザーはショートカットキーをトリガーにして音声を録音し、その後、選択した音声エンジンを通じて処理されます。システムは3つの動作モードをサポートしています:Local mode(ユーザーのGPU上でGGUFモデルを使用)、Cloud API mode(GroqやDoubaoなどのプロバイダーに直接接続)、およびServer mode(セルフホストされたFastAPIバックエンドに接続)です。文字起こしされた後、テキストはOpenAI互換のエンドポイントを使用したAIクリーンアップフェーズを通過し、文法やトーンを洗練させた上で、アクティブなウィンドウに入力されます。
Who it’s for
エディタ、チャットアプリ、ブラウザなど、さまざまなソフトウェアにおいて、音声処理の方法やプライバシー設定をコントロールしながら、執筆速度と生産性を向上させたいWindowsユーザー向けに設計されています。
Highlights
- Voice typing anywhere: Windowsのあらゆるアプリケーションに、ウィンドウを切り替えることなくテキストを直接挿入します。
- Editable AI cleanup: フィラーの削除やアイデアのフォーマット化を行うための、カスタマイズ可能なプロンプト。
- Context-aware writing: 周囲のテキストを読み取ってトーンを合わせたり、選択されたテキストに対する編集指示として機能したりできます。
- Flexible recognition: ローカルのGGUFモデル、クラウドAPI、およびセルフホストされたサーバーをサポートします。
- Overlay feedback: 録音中に視覚的な波形と、オプションのライブキャプションを提供します。
- Per-app rules: アクティブなアプリケーションに基づいて、クリーンアップの動作を自動的に切り替えます。
関連
- プロジェクト
OpenWhispr/openwhisprOpenWhispr is a cross‑platform desktop app that converts speech to text, provides live meeting transcription with speaker diarisation, and lets you talk to AI assistants (GPT‑5, Claude, Gemini, etc.) directly from your keyboard. It works offline with Whisper‑based models or via cloud services, stores notes locally (with optional cloud sync), and offers an API for programmatic use.
- プロジェクト
tover0314-w/opentypelessmacOS、Windows、Linux に対応するオープンソースのAI音声入力ツール。あらゆるデスクトップアプリで文脈に応じた音声入力、AIによるテキスト再構成、ワンショット音声Q&Aを提供します。
- プロジェクト
theJayTea/WritingToolsWriting Tools は、Windows、Linux、macOS用の無料でオープンソースのデスクトップアプリです。ホットキーでコンピュータ上のどこからでもLLMを呼び出せます。校正、再執筆、トーン変更、翻訳、WebページやYouTubeの字幕の要約、モデルとのチャットが可能です。Gemini、OpenAI、AnthropicなどのクラウドAPI、またはOllama、llama.cpp、Apple-silicon MLXを介してローカルモデルを実行できます。プライバシー重視(テレメトリなし、APIキーはローカル保存)で、GPL-v3ライセンスのもとで提供されています。
- プロジェクト
Quantatirsk/qwen3-asrQwen3‑ASR は、Qwen3‑ASR モデル(0.6 B および 1.7 B)をラップした自己ホスト型音声認識サーバーです。GPU‑vLLMバックエンドまたはCPU‑Rustバックエンドを自動選択し、OpenAIおよびAlibaba互換のHTTP/WebSocket APIを提供。話者ダイアライゼーション、VADベースのセグメンテーション、バッチ推論をサポート。Docker、カスタムGPUイメージ、オフラインtarボールでデプロイ可能。MITライセンス。
- プロジェクト
mkiol/dsnoteSpeech Note は、Linux/Sailfish デスクトップ用のオフラインアプリで、音声によるノート作成、テキスト読み上げ、翻訳をすべてローカルで実行できます。複数のオープンソース STT エンジン(Coqui STT、Vosk、Whisper cpp、Faster Whisper、April‑ASR)、多数の TTS 音声(eSpeak‑NG、Piper、RHVoice、Mimic 3 など)および Bergamot オフライン翻訳エンジンを統合しています。ユーザーは統合ブラウザ経由でモデルチェックポイントをダウンロードし、すべての処理をデバイス上で行うためプライバシーを確保できます。Flathub の Flatpak として提供され、ソースからビルドも可能です。GPL‑3.0 ライセンスです。