joewongjc/type4me
MacOS语音输入法,实时识别、大模型文本优化、全本地存储
Type4Me – macOS音声優先入力方法
何であるか – macOS専用のアプリで、音声でテキストを入力したり、翻訳したり、プロンプトを実行したり、コンピュータを音声で制御できます。ローカル音声認識エンジンとオプションのクラウドASRサービスを組み合わせ、転写されたテキストをLLMに送信して、精査、翻訳、タスク生成を行うことができます。
コア機能
- 音声→テキスト:内蔵のローカル認識エンジン(SenseVoice + Qwen3-ASR)に加え、15のクラウドASRプロバイダーに対応。話している間もストリーミング出力。
- 8つの即時利用可能なモード:クイック(生の音声入力)、IntelliSense(文脈認識による精査)、翻訳、何でも質問、macOS操作、音声精査、プロンプト最適化、タスク委任。各モードは複数のグローバルホットキー(ホールドして話す、またはトグル)に割り当て可能。
- LLM統合:主要なクラウドLLM APIまたはローカルのOllamaサーバーに接続可能。認証情報、テスト、デフォルトエンジン選択のための統一UI。
- 語彙管理:ホットワードとスニペット置換で固有名詞の誤りを修正。コンパニオン「語彙管理スキル」でこれらのルールを自動管理可能。
- メニュー・バー制御センター:モード、マイク、ASR/翻訳先の切り替え、ステータス、履歴、更新の確認。
- 履歴とエクスポート:すべての生テキストと処理済みテキストが保存され、タグ付け、確認、CSV形式でのエクスポートが可能。
- URLスキーム:
type4me://コマンドにより、外部ツール(Raycast、Alfred、Stream Deck、スクリプト)が録音の開始/停止、設定の開設、語彙の編集を、フォーカスを奪わずに行える。 - 音声修正:音声入力後にショートカットキーを押して修正を話すと、対象のテキストスロットが置き換えられ、ワンクリックで元に戻せる。
一般的なワークフロー
- ホットキー(例:
Fn)を押す → 録音開始。 - 話す;エンジンがテキストをアクティブカーソルにストリーミング。
- 選択されたモードに応じて、生テキストがLLMに送られ、精査・翻訳・タスク生成の処理を経て挿入される。
- 「何でも質問」ウィンドウで選択したテキストを問い合わせたり、会話を継続したりできる;履歴は検索可能。
- 音声だけでmacOSを制御(アプリの起動、音量調整、スクリーンショット撮影など)。
対象ユーザー
- macOSで長時間タイピングを行うプロフェッショナルで、手を離して入力したい人。
- 開発者やライターで、高速な音声入力、自動精査、即時翻訳が必要な人。
- カスタマイズ可能な音声インターフェースを求めており、macOS操作も音声でトリガーしたい人。
インストール
- 2種類のDMGビルド(クラウド対応 ≈ 10 MB、ローカルエンジン ≈ 700 MB)。両方とも同じ設定フォルダを使用するため、いつでも切り替え可能。
- macOS 14+(Sonoma)をIntelまたはApple Siliconで実行。ローカルビルドはSenseVoice用に約8 GB RAM、Qwen3-ASR用に約8 GB RAMが必要。
- ダウンロード後、DMGを開き、Type4Meをアプリケーションフォルダにドラッグ。マイク、アクセシビリティ、自動化の権限を付与。
拡張性
- ASRプロバイダーはプラグインインターフェース(
ASRProviderConfig+SpeechRecognizer)に従う。新しいサービスを追加するには、プロバイダーを登録するだけ。 - カスタムモードは、
{text}、{selected}、{clipboard}プレースホルダを参照できるプロンプトテンプレートを定義することで作成可能。
ライセンス – MIT License。
上記のすべての情報はリポジトリのREADMEから直接取得;追加機能は推測されていません。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト