murtaza-nasir/speakr

Speakr is a personal, self-hosted web application designed for transcribing audio recordings

해결하는 문제

Speakr는 사용자의 자체 인프라에서 실행되어 완전한 프라이버시를 유지하면서 음성 녹음을 정리되고 검색 가능하며 지능적인 노트로 변환하는 자체 호스팅 플랫폼입니다.

작동 방식

이 플랫폼은 네 가지 주요 단계로 구성된 파이프라인을 사용합니다.

  1. 수집: 마이크, 시스템/브라우저 오디오 또는 파일 업로드 및 감시 폴더를 통해 오디오를 녹음합니다.
  2. 음성 인식: 자체 호스팅된 WhisperX(화자 분리 및 음성 프로파일용) 또는 OpenAI, Mistral, AssemblyAI 등의 클라우드 API와 같은 다양한 ASR(자동 음성 인식) 엔진을 통합합니다.
  3. 이해: LLM을 사용하여 자동 요약, 작업 항목 및 캘린더 이벤트 추출, 개별 녹음 또는 전체 라이브러리에 대한 질의가 가능한 채팅 인터페이스(문의 모드)를 제공합니다.
  4. 정리: 폴더, 스마트 태그(자신의 AI 프롬프트를 가질 수 있음), 자동 삭제를 위한 보존 정책을 사용하여 녹음을 관리할 수 있습니다.

대상 사용자

개인 및 그룹 중 프라이버시를 중시하는 사용자를 위한 플랫폼입니다. 가족의 추억 보존, 학생의 강의 노트 작성, 전문 팀의 프로젝트 회의 관리, 법무 또는 영업 팀이 특정 보존 및 공유 정책이 필요한 경우에 적합합니다.

주요 기능

  • 유연한 음성 인식: 고품질의 분리 및 음성 임베딩을 지원하는 자체 호스팅된 WhisperX 등 다양한 백엔드를 지원합니다.
  • 지능형 노트 작성: 사용자 정의 프롬프트 기반 태그를 중첩하여 원시 트랜스크립트를 레시피나 학습 노트와 같은 특정 형식으로 변환할 수 있습니다.
  • 프라이버시 우선: 완전히 자체 호스팅되며, 단일 로그인(Single Sign-On, OIDC) 및 세밀한 공유 제어를 지원합니다.
  • 의미 기반 검색: "문의 모드"를 통해 자연어로 전체 오디오 라이브러리에 대해 채팅 및 검색이 가능합니다.
  • 자동화: n8n, Zapier, Make 등의 도구와의 통합을 위한 REST API 및 서명된 웹훅을 포함합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트