pretyflaco/millet
Fully local meeting transcription with speaker diarization, AI summaries, and PDF output
解決的問題
Millet 是一款用於從任意應用程式(Zoom、Teams、Meet 等)錄製與處理會議音訊的工具,可產生高品質、具說話人識別的轉錄文字與 AI 生成的摘要。它解決了同時擷取系統音訊與麥克風輸入的挑戰,並將原始音訊轉換為結構化、專業的文件。
工作原理
- 音訊擷取:在 Linux 上使用 PipeWire/PulseAudio 與 ffmpeg 擷取雙通道音訊(麥克風在左,系統音訊在右)。
- 轉錄:使用 WhisperX 實現快速批量轉錄,支援單字級時間戳,並支援多種 ASR 後端,包括 Apple Silicon 專用的 MLX。
- 說話人分離:使用 pyannote-audio 識別不同說話人。利用雙通道訊號自動將本地使用者標記為 "YOU",其他人則標記為 "REMOTE"。
- 摘要生成:透過 Ollama(本地)、OpenRouter、Claude Max 或硬體認證的 Tinfoil TEE 處理轉錄文字,實現最大隱私保護。產生包含待辦事項、決策與關鍵主題的結構化摘要。
- 輸出格式:產生多種格式,包括純文字、SRT、JSON 以及支援 Unicode 與 RTL 的專業 PDF。
適用對象
- 需要在多個平台間可靠記錄會議的 Linux 與 macOS 使用者。
- 追求本地優先處理或硬體認證安全飛地的 注重隱私的使用者。
- 需要結構化會議筆記、待辦事項與專業 PDF 報告的 專業人士。
主要亮點
- 應用程式無關:適用於任何透過系統喇叭播放音訊的應用程式。
- 隱私預設:包含
confidential預設,使用 Tinfoil TEE 確保提示對服務提供者不可見。 - 語音指紋識別:透過語音嵌入設定檔,自動識別跨不同會議的已知說話人。
- 語音轉 PDF:從原始音訊擷取到生成帶頁碼的專業 PDF 的完整流程。
- 結構化元資料:每個摘要均包含 YAML 前置元資料與 JSON 邊欄檔案,便於後續工具索引。
相關
- 專案
- 專案
- 專案
- 專案
- 專案