finnvoor/yap
🗣️ A CLI for on-device speech transcription using Speech.framework on macOS 26
해결하는 문제
yap는 디바이스 내에서 음성 인식을 쉽게 수행할 수 있도록 해주는 명령줄 인터페이스(CLI) 도구입니다. 음성 및 비디오 파일, 실시간 시스템 오디오, 마이크 입력을 텍스트로 변환할 수 있어 클라우드 기반의 음성 인식 서비스에 의존할 필요가 없습니다.
작동 방식
이 도구는 macOS에서 Apple의 Speech.framework를 활용하여 디바이스 내에서 음성 인식을 수행합니다. 파일(음성/비디오), 실시간 시스템 오디오(화면 녹화 권한을 통해), 마이크 입력(마이크 권한을 통해) 등 다양한 입력 소스를 지원합니다.
대상 사용자
빠르고 로컬에서 작동하는 음성 인식 도구가 필요한 macOS 사용자, 개발자 및 고급 사용자. 이 도구는 다른 CLI 도구(예: 요약용 LLM)에 연결하거나, 영상 제작용 자막 파일을 생성하는 데 사용할 수 있습니다.
주요 기능
- 다양한 입력 모드: 파일 인식, 실시간 시스템 오디오 캡처, 마이크 입력 녹음(딕테이션)을 지원합니다.
- 유연한 출력 형식: 텍스트, SRT, VTT, JSON 형식으로 내보낼 수 있습니다.
- 회의 음성 인식:
listen-and-dictate명령어는 시스템 오디오와 마이크 입력을 동시에 인식하며, 사용자 정의 화자 라벨을 지정할 수 있습니다. - MCP 서버: 모델 컨텍스트 프로토콜(MCP) 서버를 포함하여 AI 에이전트가
transcribe도구를 사용할 수 있도록 합니다. - 로컬 처리: 모든 음성 인식은 macOS 프레임워크를 사용해 디바이스 내에서 수행됩니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트