pretyflaco/millet

Fully local meeting transcription with speaker diarization, AI summaries, and PDF output

解决的问题

Millet 是一款用于从任意应用程序(Zoom、Teams、Meet 等)录制和处理会议音频的工具,可生成高质量、带说话人识别的转录文本和 AI 生成的摘要。它解决了同时捕获系统音频和麦克风输入的挑战,并将原始音频转化为结构化、专业的文档。

工作原理

  • 音频捕获:在 Linux 上使用 PipeWire/PulseAudio 和 ffmpeg 捕获双通道音频(麦克风在左,系统音频在右)。
  • 转录:使用 WhisperX 实现快速批量转录,支持单词级时间戳,并支持多种 ASR 后端,包括 Apple Silicon 专用的 MLX。
  • 说话人分离:使用 pyannote-audio 识别不同说话人。利用双通道信号自动将本地用户标记为 "YOU",其他人为 "REMOTE"。
  • 摘要生成:通过 Ollama(本地)、OpenRouter、Claude Max 或硬件认证的 Tinfoil TEE 处理转录文本,实现最大隐私保护。生成包含待办事项、决策和关键主题的结构化摘要。
  • 输出格式:生成多种格式,包括纯文本、SRT、JSON 以及支持 Unicode 和 RTL 的专业 PDF。

适用人群

  • 需要在多个平台间可靠记录会议的 Linux 和 macOS 用户
  • 追求本地优先处理或硬件认证安全飞地的 注重隐私的用户
  • 需要结构化会议笔记、待办事项和专业 PDF 报告的 专业人士

主要亮点

  • 应用无关:适用于任何通过系统扬声器播放音频的应用程序。
  • 隐私预设:包含 confidential 预设,使用 Tinfoil TEE 确保提示对服务提供商不可见。
  • 语音指纹识别:通过语音嵌入配置文件,自动识别跨不同会议的已知说话人。
  • 语音转 PDF:从原始音频捕获到生成带页码的专业 PDF 的完整流程。
  • 结构化元数据:每个摘要均包含 YAML 前置元数据和 JSON 侧边文件,便于下游工具索引。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目