royshil/obs-localvocal

OBS plugin for local speech recognition and captioning using AI

解決する課題

LocalVocalは、リアルタイムの音声からテキストへの書き起こしと翻訳を提供するOBSプラグインです。ストリーマーやコンテンツクリエイターが、クラウドサービスに依存することなく、画面上にライブ字幕を表示したり、ファイルに保存したりすることを可能にし、プライバシーを確保し、ネットワーク遅延やコストを排除します。

仕組み

このプラグインは、CPUおよびGPU上での効率的なローカル実行のために、Whisper.cppを介してOpenAIのWhisperモデルを統合しています。翻訳にはCTranslate2を利用しています。CUDA (NVIDIA)、hipBLAS (AMD)、Metal (Apple Silicon)、Vulkanを含む幅広いハードウェアアクセラレーションバックエンドをサポートしており、ハイエンドのGPUを必要とせずに様々なハードウェア構成で動作します。

対象者

オーディオストリームを複数の言語にリアルタイムかつプライベートに、ローカルで書き起こし・翻訳する必要があるOBS Studioユーザー向けに設計されています。

ハイライト

  • ローカル処理: すべてのデータはマシン内に留まり、クラウドコスト、ネットワーク接続、またはGPUを必要としません(ただし、GPUアクセラレーションはサポートされています)。
  • 多言語サポート: 100言語の音声を書き起こし、字幕をリアルタイムで翻訳します。
  • 柔軟な出力: 字幕はOBSのテキストソースとして表示したり、.txtまたは.srtファイルに保存したり、RTMPストリームを介してYouTubeやTwitchなどのプラットフォームに送信したりできます。
  • ハードウェアの汎用性: Windows、macOS、Linuxにわたる幅広いCPUおよびGPUバックエンドをサポートしています。
  • カスタマイズ可能なモデル: 組み込みのWhisperモデルをダウンロードするか、独自のGGML Whisperモデルファイルを提供することができます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト