murtaza-nasir/speakr

Speakr is a personal, self-hosted web application designed for transcribing audio recordings

解决的问题

Speakr 是一个自托管平台,旨在将音频记录转化为结构化、可搜索且智能的笔记,同时通过在用户自己的基础设施上运行来确保完全隐私。

工作原理

该平台采用包含四个主要阶段的流水线:

  1. 采集:通过麦克风、系统/浏览器音频或文件上传及监视文件夹方式录制音频。
  2. 转录:集成多种 ASR(自动语音识别)引擎,包括自托管的 WhisperX(用于说话人分离和语音特征)或 OpenAI、Mistral、AssemblyAI 等云 API。
  3. 理解:使用 LLM 生成自动摘要、提取待办事项和日历事件,并提供聊天界面,用于查询单个录音或整个库(查询模式)。
  4. 组织:用户可使用文件夹、智能标签(可携带自己的 AI 提示)和保留策略(自动删除)来管理录音。

适用人群

专为注重隐私的个人和团体设计,包括保存家庭记忆的家庭、记录讲座笔记的学生、管理项目讨论的专业团队,以及需要特定保留和共享策略的法律或销售团队。

主要亮点

  • 灵活的转录:支持多种后端,包括自托管 WhisperX,实现高质量的说话人分离和语音嵌入。
  • 智能笔记:支持自定义提示驱动的标签,可堆叠使用,将原始转录文本转换为食谱、学习笔记等特定格式。
  • 隐私优先:完全自托管,支持单点登录(OIDC)和细粒度共享控制。
  • 语义搜索:"查询模式"支持自然语言聊天和对整个音频库的搜索。
  • 自动化:提供 REST API 和签名 Webhook,可与 n8n、Zapier、Make 等工具集成。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目