ideaplexa/voicetypr

Voicetypr - AI powered offline voice to text dictation tool for busy founders, vibe coders, AI power users on macos, windows. Alternative to wispr flow and superwhisper.

Voicetyprとは?

Voicetyprは、macOSおよびWindows向けの オフラインファーストのデスクトップディクテーションツール です。PC上のどこでも音声入力が可能で、ローカルまたはオプションのクラウド音声認識モデルを使用して文字起こしを行い、結果をカーソル位置に直接挿入します。


コアコンセプト (READMEより)

コンセプト 意味
システム全体でのディクテーション グローバルホットキーで録音の開始/停止ができるため、あらゆるアプリ(メール、コードエディタ、ブラウザなど)でディクテーション可能です。
デフォルトでローカル文字起こし OpenAI-Whisper (macOS & Windows) および Apple Silicon に最適化された Parakeet モデルを使用します。クラウドプロバイダーを選択しない限り、インターネット通信は発生しません。
オプションのクラウドプロバイダー 別のサービスを好む場合は、Soniox、OpenAI、Groq、Deepgram、Cohere を指定できます。
AIフォーマット 文字起こし後、生のテキストをLLM(OpenAI、Anthropic、Gemini、またはOpenAI互換エンドポイント)で整形できます。
CLI & エージェント統合 voicetypr コマンドラインツールにより、スクリプトや自律エージェントが同じ文字起こしパイプラインにアクセスし、プレーンテキストや構造化されたJSONを取得できます。
ネットワーク共有 1つのVoicetyprインスタンスをLAN上のプライベート文字起こしサーバーとして機能させ、他のインストール環境から処理をオフロードできます。
ローカルモデルの永久ライセンス トライアル後、一度購入すればローカル実行モデルの分単位の料金は発生しません。

主な機能

  • グローバルショートカット、プッシュ・トゥ・トーク、録音切り替え、カーソルへの自動挿入
  • Whisper (macOS/Windows) + Parakeet (Apple Silicon) によるデバイス内文字起こし
  • クラウドSTTオプション (Soniox, OpenAI, Groq, Deepgram, Cohere)
  • OpenAI/Anthropic/GeminiまたはカスタムエンドポイントによるLLMベースのテキスト整形
  • 音声/動画ファイルの文字起こし;クラウドプロバイダーによる話者分離 (diarization) 対応
  • 履歴表示(検索、メタデータ、生テキストと整形テキストの比較、コピー、再文字起こし)
  • LANベースのプライベート文字起こしサーバー (ネットワーク共有)
  • エージェント対応CLI (voicetypr transcribe … --json など)
  • 安定版/ベータ版アップデートチャンネル;Microsoft Store版はストアの更新に従う
  • Rustバックエンドによる軽量なReact UI(音声キャプチャ、ホットキー、カーソル挿入)

使用方法

  1. インストール – macOS 14+ DMG または Windowsインストーラー / Microsoft Store。
  2. 権限付与 – マイク権限、および (macOS) カーソル挿入のためのアクセシビリティ権限。
  3. モデルのダウンロード – アプリがWhisper/Parakeetファイルを一度だけ取得し、ローカルに保存します。
  4. ホットキーの設定 – 設定 → 一般でグローバルショートカットを選択します。
  5. ディクテーション – テキストフィールドにカーソルを置き、ショートカットを押して話し、停止します。
  6. 結果 – Voicetyprがカーソル位置に文字起こし結果を入力し、履歴に保存します。

コマンドラインインターフェース (CLI)

CLIはスクリプトやAIエージェント向けにGUI機能をミラーリングしています:

voicetypr status --json          # ヘルス情報
voicetypr models --json          # 利用可能なローカル/クラウドモデル一覧
voicetypr transcribe --file note.wav --json   # ファイル → テキスト/JSON
voicetypr record --until-silence --json       # ライブマイクキャプチャ

デフォルトは人間が読みやすい出力ですが、--json を指定すると自動化に適した構造化オブジェクトが返されます。リモートサーバーやクラウドプロバイダーを明示的に要求しない限り、音声データがマシンから外部へ送信されることはありません。


プライバシーとデータフロー

モード 外部へ送信されるデータ
ローカル文字起こし なし – 音声とテキストはデバイス内に留まります。
クラウド文字起こし 録音された音声が選択したSTTプロバイダーに送信されます。
AIフォーマット 生の文字起こしテキストが設定されたLLMサービスに送信されます。
ネットワーク共有 設定したVoicetyprサーバー(LANまたは他のネットワーク)に音声が送信されます。
診断と分析は設定で切り替え可能です。プロジェクトのプライバシーポリシーに保持期間の詳細が記載されています。

技術スタック

  • デスクトップシェル: Tauri v2 (Rust + webview) - ネイティブウィンドウ、自動更新、権限管理。
  • フロントエンド: React 19, TypeScript, Tailwind CSS, shadcn/ui, Zustand 状態管理。
  • バックエンド: Rust - 音声キャプチャ、リサンプリング、ホットキー、文字起こしオーケストレーション、履歴、カーソル挿入。
  • ローカルエンジン: Whisper (CPU) - 両OS対応;Parakeet (Apple Silicon);Vulkan加速Whisper (Windowsオプション)。
  • ネットワーク共有: 同じRustバックエンド上に構築された認証済みクライアント/サーバー。

コードの取得とビルド

git clone https://github.com/ideaplexa/voicetypr.git
cd voicetypr
pnpm install               # Node + React 依存関係
pnpm tauri:dev             # 開発モードで実行 (Rustツールチェーン、Tauriの前提条件が必要)

前提条件:Node + pnpm, Rust stable, Tauri v2プラットフォームツール, Xcode CLI (macOS) または Visual Studio Build Tools (Windows)。Lint、型チェック、テストスクリプト (pnpm lint, pnpm test など) が提供されています。


ライセンスとコミュニティ

  • ライセンス: GNU Affero General Public License v3 (AGPL-3.0)。
  • サポート: GitHub Issues、アプリ内の「問題を報告」、ドキュメント・変更履歴・ヘルプページを備えた公開ウェブサイト。
  • 貢献: AGENTS.md および CLAUDE.md のガイドラインに従ってください。プラットフォーム固有の動作を明示し、Windows上のCPUセーフなメインプロセスを維持してください。

結論

Voicetyprは、Whisperベースの音声認識をローカルで実行することでプライバシーを優先しつつ、クラウドやLLMベースの整形をオプションとして提供する、完全にオープンソースのクロスプラットフォーム・ディクテーションアプリです。CLIにより自動化やAIエージェントのワークフローに活用でき、RustコアとReact UIの組み合わせにより、モダンなUIでネイティブなパフォーマンスを実現しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト