homelab-00/TranscriptionSuite

A fully local and private Speech-To-Text app, offering multiple model backends, diarization & calendar mode - Available for Windows, macOS & Linux

何を解決するか

TranscriptionSuite は、ユーザーが自宅のコンピュータ上で音声をテキストに変換できる無料でオープンソースのアプリケーションです。音声データをクラウドサービスに送信する必要がなく、プライバシーとセキュリティを確保しながら、話者ラベル付きの正確なトランスクリプトを提供します。

動作方法

このプロジェクトは、2つの主要なコンポーネントから構成されています:Electronで構築されたデスクトップダッシュボードと、Pythonバックエンドのトランスクリプションサーバーです。サーバーはApple Silicon上でMetal/MLX経由でネイティブに実行可能であり、WindowsおよびLinuxではDockerコンテナ内で実行可能です。Whisper、NVIDIA NeMo、VibeVoice-ASR、SenseVoice、whisper.cppなど、複数の音声認識バックエンドをサポートしており、NVIDIA CUDA、Apple Metal、AMD/Intel Vulkanによるハードウェアアクセラレーションも利用可能です。

対象ユーザー

プライベートでローカルにトランスクリプトが必要なすべての人々に向けられています。たとえば、講義を録音する学生、文書を音声入力するプロフェッショナル、または検索可能なノートブックと統合されたAIアシスタントで音声ノートを管理したいユーザーです。

特徴

  • 100% ローカル & プライベート:音声データとトランスクリプトは機械から一切出ません。
  • 話者ダイアライゼーション:PyAnnote、CAM++、Sortformer、または組み込みモデル機能を使用して、「誰が何を言ったか」を自動ラベル付けします。
  • マルチバックエンド対応:Whisper、NeMo、SenseVoiceなどさまざまなモデルと、NVIDIA、Apple Silicon、AMD/Intelなどのハードウェアに対応しています。
  • ライブモード:継続的な音声入力に適した、リアルタイムで文単位のトランスクリプト。
  • オーディオノートブック:カレンダー表示のストレージシステムで、全文検索とOpenAI互換プロバイダーに対応するAIアシスタントを備えています。
  • 広範な互換性:Whisperで90か国語以上をサポートし、Canary v2で欧州言語の双方向翻訳を実現しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト