harry0703/AudioNotes
快速提取音视频内容,整理成一份结构化的markdown笔记
해결하는 문제
AudioNotes는 음성 및 동영상 녹음을 구조화된 텍스트와 지능적인 노트로 변환하는 사생활 보호 중심의 로컬 솔루션을 제공합니다. 민감한 회의, 인터뷰, 강의 데이터를 클라우드 기반 AI 서비스에 전송할 필요 없이, 프라이버시를 보장하면서도 자동으로 음성 인식 및 요약을 수행할 수 있습니다.
작동 방식
이 도구는 전용 모델을 조합하여 로컬에서 실행됩니다. 음성 인식에는 FunASR를 사용하고, Ollama를 통해 대규모 언어 모델(예: qwen3.5:2b)을 실행하여 트랜스크립트를 Markdown 노트로 정리하고 콘텐츠에 대한 추가 질문에 답변합니다. Docker를 통해 배포하거나 소스 코드에서 직접 실행할 수 있습니다.
대상 사용자
회의, 인터뷰, 강의, 음성 메모를 정리해야 하지만 높은 데이터 프라이버시를 요구하며, AI 도구를 자체 하드웨어에서 실행하는 것을 선호하는 개인 사용자에게 적합합니다.
주요 특징
- 로컬 우선 프라이버시: 오디오, 트랜스크립트, 노트는 모두 로컬 머신에 저장되며, 기본적으로 제3자 AI API로 데이터가 전송되지 않습니다.
- 엔드투엔드 워크플로우: 브라우저 기반 녹음 및 파일 업로드부터 트랜스크립트 생성, 구조화된 노트 생성까지 모든 과정을 처리합니다.
- 인터랙티브 Q&A: 업로드한 오디오 또는 동영상 콘텐츠에 대해 구체적인 질문을 할 수 있습니다.
- 유연한 배포: CPU 기반 Docker 환경과 NVIDIA 카드를 갖춘 Linux 사용자를 위한 GPU 가속 구성 모두 지원합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트