pretyflaco/millet
Fully local meeting transcription with speaker diarization, AI summaries, and PDF output
해결하는 문제
Millet은 Zoom, Teams, Meet 등 다양한 애플리케이션에서 회의 음성을 기록하고 처리하여 고품질의 말하는 사람을 식별한 트랜스크립트와 AI 생성 요약을 만드는 도구입니다. 시스템 오디오와 마이크 입력을 동시에 캡처하는 어려움을 해결하고, 원시 오디오를 구조화되고 전문적인 문서로 변환합니다.
작동 방식
- 오디오 캡처: Linux에서는 PipeWire/PulseAudio와 ffmpeg를 사용하여 이중 채널 오디오(마이크: 왼쪽, 시스템 오디오: 오른쪽)를 기록합니다.
- 트랜스크립션: WhisperX를 사용하여 빠르고 배치 처리된 트랜스크립션을 수행하며, 단어 수준의 타임스탬프를 지원하고 MLX(Apple Silicon용)을 포함한 여러 ASR 백엔드를 지원합니다.
- 화자 분리: pyannote-audio를 사용하여 다양한 화자를 식별합니다. 이중 채널 신호를 활용해 로컬 사용자를 "YOU", 다른 사람을 "REMOTE"로 자동 레이블링합니다.
- 요약 생성: Ollama(로컬), OpenRouter, Claude Max, 또는 하드웨어 검증된 Tinfoil TEE를 통해 LLM에 트랜스크립트를 전달합니다. 작업 항목, 결정 사항, 주요 주제를 포함한 구조화된 요약을 생성합니다.
- 출력 형식: 일반 텍스트, SRT, JSON, 유니코드 및 RTL 지원이 있는 전문적인 PDF 등 다양한 형식을 생성합니다.
대상 사용자
- 다양한 플랫폼에서 회의를 기록할 필요가 있는 Linux 및 macOS 사용자.
- 로컬 우선 처리 또는 회의 데이터를 위한 하드웨어 검증된 보안 환경을 원하는 프라이버시에 민감한 사용자.
- 구조화된 회의 노트, 작업 항목, 전문적인 PDF 보고서를 필요로 하는 전문가.
주요 기능
- 앱 독립성: 시스템 스피커를 통해 오디오를 재생하는 모든 앱과 호환됩니다.
- 프라이버시 프리셋:
confidential프리셋은 Tinfoil TEE를 사용하여 프로바이더가 프롬프트를 볼 수 없도록 보장합니다. - 음성 프린트 인식: 음성 임베딩 프로파일을 사용하여 다양한 회의에서 알려진 화자를 자동으로 식별합니다.
- 음성 → PDF: 원시 오디오 캡처에서 페이지 번호가 있는 전문적인 PDF까지 완전한 파이프라인을 제공합니다.
- 구조화된 메타데이터: 모든 요약에는 YAML 프론트마터와 JSON 사이드카가 포함되어 후속 도구에 의한 인덱싱이 용이합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트