murtaza-nasir/speakr
Speakr is a personal, self-hosted web application designed for transcribing audio recordings
解决的问题
Speakr 是一个自托管平台,旨在将音频记录转化为结构化、可搜索且智能的笔记,同时通过在用户自己的基础设施上运行来确保完全隐私。
工作原理
该平台采用包含四个主要阶段的流水线:
- 采集:通过麦克风、系统/浏览器音频或文件上传及监视文件夹方式录制音频。
- 转录:集成多种 ASR(自动语音识别)引擎,包括自托管的 WhisperX(用于说话人分离和语音特征)或 OpenAI、Mistral、AssemblyAI 等云 API。
- 理解:使用 LLM 生成自动摘要、提取待办事项和日历事件,并提供聊天界面,用于查询单个录音或整个库(查询模式)。
- 组织:用户可使用文件夹、智能标签(可携带自己的 AI 提示)和保留策略(自动删除)来管理录音。
适用人群
专为注重隐私的个人和团体设计,包括保存家庭记忆的家庭、记录讲座笔记的学生、管理项目讨论的专业团队,以及需要特定保留和共享策略的法律或销售团队。
主要亮点
- 灵活的转录:支持多种后端,包括自托管 WhisperX,实现高质量的说话人分离和语音嵌入。
- 智能笔记:支持自定义提示驱动的标签,可堆叠使用,将原始转录文本转换为食谱、学习笔记等特定格式。
- 隐私优先:完全自托管,支持单点登录(OIDC)和细粒度共享控制。
- 语义搜索:"查询模式"支持自然语言聊天和对整个音频库的搜索。
- 自动化:提供 REST API 和签名 Webhook,可与 n8n、Zapier、Make 等工具集成。
相关
- 项目
- 项目
- 项目
- 项目
- 项目