Muesli-HQ/muesli

Muesli - agent-native local meeting transcription + dictation for macOS (Granola + WisprFlow alternative)

해결하는 문제

Muesli는 개인 정보 보호를 중시하고 기본적으로 로컬에서 작동하는 네이티브 macOS 앱입니다. 클라우드 서비스에 의존하지 않고도 어떤 애플리케이션에 텍스트를 음성 입력하거나, 말하는 사람을 식별할 수 있는 회의 음성 전사 기능을 원활하게 제공합니다.

작동 방식

이 앱은 Apple Silicon의 Neural Engine, CoreML, Metal을 활용해 다양한 ASR(음성 인식) 모델을 디바이스 내에서 로컬로 실행합니다. CoreAudio와 ScreenCaptureKit을 사용해 마이크 및 시스템 오디오(회의용)를 캡처합니다. 회의 전사 기능은 VAD(음성 활동 탐지)를 사용해 자연스러운 발화 경계에서 오디오를 분할하고, CoreML 기반의 다이어라이제이션 모델로 다양한 화자를 식별합니다.

대상 사용자

시스템과 통합되며, 완전히 오프라인으로 작동하는 고성능의 개인 정보 보호형 음성 입력 및 회의 전사 도구가 필요한 macOS 사용자(예: Google Calendar, Apple Shortcuts와의 연동).

주요 기능

  • 로컬 우선 ASR: Parakeet, Nemotron, Whisper, Gemma 4 등 다양한 로컬 모델을 지원하며, 지연 시간은 최소 0.13초.
  • 회의 인텔리전스: 자동 화자 다이어라이제이션, 카메라 기반 회의 감지, Google Calendar 연동을 통한 자동 전사 트리거.
  • 참여 및 전사: 캘린더 이벤트에서 회의 URL을 추출해 회의에 참여하고 동시에 전사를 시작.
  • 에이전트 친화적 CLI: 내장된 CLI(muesli-cli)를 제공하여 코드 에이전트가 오디오 파일을 프로그래밍 방식으로 전사하고 JSON을 통해 회의 노트를 관리할 수 있음.
  • 개인정보 중심: 오디오는 기본적으로 디바이스 내부에 머무르며, OpenAI 또는 OpenRouter용 고급 정리 및 요약을 위해 선택적 BYOK(Bring Your Own Key) 통합 지원.
  • 시스템 통합: Apple Shortcuts, Siri, iCloud와 깊이 통합되어 Mac과 iPhone 간 텍스트 동기화 가능.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트