murtaza-nasir/speakr

Speakr is a personal, self-hosted web application designed for transcribing audio recordings

何を解決するか

Speakr は、ユーザー自身のインフラストラクチャ上で実行されることで完全なプライバシーを保ちながら、音声記録を整理され、検索可能で知的なノートに変換する自己ホスト型プラットフォームです。

動作方法

このプラットフォームは、4つの主要ステージからなるパイプラインを使用しています。

  1. 収集: マイク、システム/ブラウザ音声、またはファイルアップロードおよびウォッチフォルダ経由で音声を記録します。
  2. 音声認識: WhisperX(スピーカーの話者分離とボイスプロファイル用)などの自己ホスト型 ASR(自動音声認識)エンジン、または OpenAI、Mistral、AssemblyAI などのクラウド API を統合しています。
  3. 理解: LLM を使用して自動要約、アクションアイテムやカレンダーイベントの抽出、個々の記録または全体のライブラリに対するクエリが可能なチャットインターフェース(Inquire Mode)を提供します。
  4. 整理: フォルダ、スマートタグ(独自の AI プロンプトを保持可能)、自動削除を実行する保留ポリシーを使用して記録を管理できます。

対象ユーザー

プライバシーを重視する個人やグループ向けに設計されています。家族の思い出の保存、学生の講義メモ、プロフェッショナルチームのプロジェクト会議管理、法務や営業チームにおける特定の保持および共有ポリシーが必要なケースに最適です。

特徴

  • 柔軟な音声認識: 高品質な話者分離とボイス埋め込みに対応する自己ホスト型 WhisperX など、複数のバックエンドをサポート。
  • 知的なノート作成: プロンプトベースのタグをカスタマイズ可能で、スタックしてレシピや勉強ノートなどの特定フォーマットに変換可能。
  • プライバシー最優先: オンプレミス完全自己ホスト型で、Single Sign-On(OIDC)と細かい共有制御をサポート。
  • 意味的検索: 「Inquire Mode」により、自然言語でのチャットと全体の音声ライブラリに対する検索が可能。
  • 自動化: n8n、Zapier、Make などのツールとの統合に使用可能な REST API と署名付き Webhook を搭載。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト