finnvoor/yap

🗣️ A CLI for on-device speech transcription using Speech.framework on macOS 26

何を解決するか

yap は、デバイス上で音声をテキストに変換するためのコマンドラインインターフェース(CLI)ツールです。音声ファイルや動画ファイル、リアルタイムのシステム音声、マイク入力をテキストに変換でき、クラウドベースの音声認識サービスへの依存を回避できます。

動作方法

このツールは、macOS 上で Apple の Speech.framework を活用して、デバイス上で音声認識を実行します。複数の入力ソースをサポートしています:ファイル(音声/動画)、リアルタイムのシステム音声(スクリーンレコーディング権限経由)、マイク入力(マイク権限経由)。

対象ユーザー

音声認識を高速かつローカルで行いたい開発者やパワーユーザー。他の CLI ツール(例:要約用のLLM)にパイプできる、または動画制作用の字幕ファイルを生成するのに使えるツールが必要な方。

特徴

  • 複数の入力モード:ファイルの音声認識、リアルタイムのシステム音声キャプチャ、マイク入力による音声入力(ディクテーション)をサポート。
  • 柔軟な出力フォーマット:プレーンテキスト、SRT、VTT、JSON へのエクスポートをサポート。
  • ミーティング音声認識listen-and-dictate コマンドは、システム音声とマイク入力を同時に認識でき、カスタムの話者ラベルを設定可能。
  • MCP サーバー:Model Context Protocol (MCP) サーバーを内蔵しており、AIエージェントが transcribe ツールを利用できるようにします。
  • ローカル処理:すべての音声認識処理は、macOS のフレームワークを使用してデバイス上で実行されます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト