pretyflaco/millet
Fully local meeting transcription with speaker diarization, AI summaries, and PDF output
何を解決するか
Millet は、任意のアプリケーション(Zoom、Teams、Meet など)から会議音声を記録・処理し、高品質で話者識別付きのトランスクリプトと AI 生成の要約を作成するツールです。システム音声とマイク入力を同時に取得する課題を解決し、その生の音声データを構造的でプロフェッショナルな文書に変換します。
動作方法
- 音声キャプチャ: Linux では PipeWire/PulseAudio と ffmpeg を使用して、双方向音声(マイク:左、システム音声:右)を記録します。
- トランスクリプション: WhisperX を使用して高速でバッチ処理されたトランスクリプションを実行し、単語レベルのタイムスタンプを提供。MLX(Apple Silicon 向け)を含む複数の ASR バックエンドをサポート。
- 話者分離: pyannote-audio を活用して異なる話者を識別。双方向信号を用いて、ローカルユーザーを「YOU」と自動ラベル付け、他の参加者を「REMOTE」とラベル付けします。
- 要約生成: Ollama(ローカル)、OpenRouter、Claude Max、またはハードウェア検証済みの Tinfoil TEE を通じて LLM にトランスクリプトを処理。アクションアイテム、決定事項、主要トピックを含む構造化された要約を生成します。
- 出力形式: プレーンテキスト、SRT、JSON、Unicode および RTL 対応のプロフェッショナル PDF など、複数のフォーマットを生成します。
対象ユーザー
- 複数のプラットフォームで会議を記録する必要がある Linux および macOS ユーザー。
- ローカル優先の処理や、ハードウェア検証済みのセキュアエンクロージャーを求める プライバシー重視のユーザー。
- 構造化された会議メモ、アクションアイテム、プロフェッショナル PDF レポートを必要とする プロフェッショナル。
特徴
- アプリ非依存: システムスピーカー経由で音声を再生する任意のアプリと連携可能。
- プライバシー設定:
confidential設定では Tinfoil TEE を使用し、プロバイダーがプロンプトを可視化できないようにします。 - ボイスプリント認識: 音声埋め込みプロファイルを用いて、異なる会議間で既知の話者を自動識別。
- 音声からPDFへ: 生音声キャプチャからページ番号付きのプロフェッショナル PDF まで一貫したパイプライン。
- 構造化メタデータ: すべての要約には YAML フロントマターと JSON サイドカーが含まれ、後続ツールによるインデキシングを容易にします。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト