joewongjc/type4me

MacOS语音输入法,实时识别、大模型文本优化、全本地存储

Type4Me – macOS音声優先入力方法

何であるか – macOS専用のアプリで、音声でテキストを入力したり、翻訳したり、プロンプトを実行したり、コンピュータを音声で制御できます。ローカル音声認識エンジンとオプションのクラウドASRサービスを組み合わせ、転写されたテキストをLLMに送信して、精査、翻訳、タスク生成を行うことができます。

コア機能

  • 音声→テキスト:内蔵のローカル認識エンジン(SenseVoice + Qwen3-ASR)に加え、15のクラウドASRプロバイダーに対応。話している間もストリーミング出力。
  • 8つの即時利用可能なモード:クイック(生の音声入力)、IntelliSense(文脈認識による精査)、翻訳、何でも質問、macOS操作、音声精査、プロンプト最適化、タスク委任。各モードは複数のグローバルホットキー(ホールドして話す、またはトグル)に割り当て可能。
  • LLM統合:主要なクラウドLLM APIまたはローカルのOllamaサーバーに接続可能。認証情報、テスト、デフォルトエンジン選択のための統一UI。
  • 語彙管理:ホットワードとスニペット置換で固有名詞の誤りを修正。コンパニオン「語彙管理スキル」でこれらのルールを自動管理可能。
  • メニュー・バー制御センター:モード、マイク、ASR/翻訳先の切り替え、ステータス、履歴、更新の確認。
  • 履歴とエクスポート:すべての生テキストと処理済みテキストが保存され、タグ付け、確認、CSV形式でのエクスポートが可能。
  • URLスキームtype4me:// コマンドにより、外部ツール(Raycast、Alfred、Stream Deck、スクリプト)が録音の開始/停止、設定の開設、語彙の編集を、フォーカスを奪わずに行える。
  • 音声修正:音声入力後にショートカットキーを押して修正を話すと、対象のテキストスロットが置き換えられ、ワンクリックで元に戻せる。

一般的なワークフロー

  1. ホットキー(例:Fn)を押す → 録音開始。
  2. 話す;エンジンがテキストをアクティブカーソルにストリーミング。
  3. 選択されたモードに応じて、生テキストがLLMに送られ、精査・翻訳・タスク生成の処理を経て挿入される。
  4. 「何でも質問」ウィンドウで選択したテキストを問い合わせたり、会話を継続したりできる;履歴は検索可能。
  5. 音声だけでmacOSを制御(アプリの起動、音量調整、スクリーンショット撮影など)。

対象ユーザー

  • macOSで長時間タイピングを行うプロフェッショナルで、手を離して入力したい人。
  • 開発者やライターで、高速な音声入力、自動精査、即時翻訳が必要な人。
  • カスタマイズ可能な音声インターフェースを求めており、macOS操作も音声でトリガーしたい人。

インストール

  • 2種類のDMGビルド(クラウド対応 ≈ 10 MB、ローカルエンジン ≈ 700 MB)。両方とも同じ設定フォルダを使用するため、いつでも切り替え可能。
  • macOS 14+(Sonoma)をIntelまたはApple Siliconで実行。ローカルビルドはSenseVoice用に約8 GB RAM、Qwen3-ASR用に約8 GB RAMが必要。
  • ダウンロード後、DMGを開き、Type4Meをアプリケーションフォルダにドラッグ。マイク、アクセシビリティ、自動化の権限を付与。

拡張性

  • ASRプロバイダーはプラグインインターフェース(ASRProviderConfig + SpeechRecognizer)に従う。新しいサービスを追加するには、プロバイダーを登録するだけ。
  • カスタムモードは、{text}{selected}{clipboard} プレースホルダを参照できるプロンプトテンプレートを定義することで作成可能。

ライセンス – MIT License。


上記のすべての情報はリポジトリのREADMEから直接取得;追加機能は推測されていません。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト