murtaza-nasir/speakr
Speakr is a personal, self-hosted web application designed for transcribing audio recordings
解決的問題
Speakr 是一個自托管平台,旨在將音訊錄音轉換為結構化、可搜尋且具智慧的筆記,同時透過在使用者自己的基礎設施上執行,確保完全的隱私。
運作方式
此平台採用包含四個主要階段的流程:
- 收集:透過麥克風、系統/瀏覽器音訊,或檔案上傳及監視資料夾方式錄製音訊。
- 轉錄:整合多種 ASR(自動語音辨識)引擎,包括自托管的 WhisperX(用於說話人分離與語音特徵)或 OpenAI、Mistral、AssemblyAI 等雲端 API。
- 理解:使用 LLM 生成自動摘要、提取待辦事項與日曆事件,並提供聊天介面,用於查詢單一錄音或整個資料庫(查詢模式)。
- 組織:使用者可使用資料夾、智慧標籤(可攜帶自己的 AI 提示)和保留策略(自動刪除)來管理錄音。
適用對象
專為重視隱私的個人與團體設計,包括保存家庭記憶的家庭、記錄講座筆記的學生、管理專案討論的專業團隊,以及需要特定保留與分享策略的法律或銷售團隊。
主要特色
- 彈性轉錄:支援多種後端,包括自托管 WhisperX,實現高品質的說話人分離與語音嵌入。
- 智慧筆記:支援自訂提示驅動的標籤,可堆疊使用,將原始轉錄內容轉換為食譜、學習筆記等特定格式。
- 隱私優先:完全自托管,支援單一登入(OIDC)與細粒度分享控制。
- 語意搜尋:「查詢模式」支援自然語言聊天與對整個音訊資料庫的搜尋。
- 自動化:提供 REST API 與簽署式 Webhook,可與 n8n、Zapier、Make 等工具整合。
相關
- 專案
- 專案
- 專案
- 專案
- 專案