pretyflaco/millet
Fully local meeting transcription with speaker diarization, AI summaries, and PDF output
解决的问题
Millet 是一款用于从任意应用程序(Zoom、Teams、Meet 等)录制和处理会议音频的工具,可生成高质量、带说话人识别的转录文本和 AI 生成的摘要。它解决了同时捕获系统音频和麦克风输入的挑战,并将原始音频转化为结构化、专业的文档。
工作原理
- 音频捕获:在 Linux 上使用 PipeWire/PulseAudio 和 ffmpeg 捕获双通道音频(麦克风在左,系统音频在右)。
- 转录:使用 WhisperX 实现快速批量转录,支持单词级时间戳,并支持多种 ASR 后端,包括 Apple Silicon 专用的 MLX。
- 说话人分离:使用 pyannote-audio 识别不同说话人。利用双通道信号自动将本地用户标记为 "YOU",其他人为 "REMOTE"。
- 摘要生成:通过 Ollama(本地)、OpenRouter、Claude Max 或硬件认证的 Tinfoil TEE 处理转录文本,实现最大隐私保护。生成包含待办事项、决策和关键主题的结构化摘要。
- 输出格式:生成多种格式,包括纯文本、SRT、JSON 以及支持 Unicode 和 RTL 的专业 PDF。
适用人群
- 需要在多个平台间可靠记录会议的 Linux 和 macOS 用户。
- 追求本地优先处理或硬件认证安全飞地的 注重隐私的用户。
- 需要结构化会议笔记、待办事项和专业 PDF 报告的 专业人士。
主要亮点
- 应用无关:适用于任何通过系统扬声器播放音频的应用程序。
- 隐私预设:包含
confidential预设,使用 Tinfoil TEE 确保提示对服务提供商不可见。 - 语音指纹识别:通过语音嵌入配置文件,自动识别跨不同会议的已知说话人。
- 语音转 PDF:从原始音频捕获到生成带页码的专业 PDF 的完整流程。
- 结构化元数据:每个摘要均包含 YAML 前置元数据和 JSON 侧边文件,便于下游工具索引。
相关
- 项目
- 项目
- 项目
- 项目
- 项目