mybigday/whisper.rn

React Native binding of whisper.cpp.

解決する課題

whisper.rn は、高性能なデバイス上での自動音声認識 (ASR) を行うための React Native バインディングを提供します。これにより、開発者はクラウドベースの文字起こしサービスに依存することなく、OpenAI の Whisper および NVIDIA Parakeet モデルをモバイルアプリケーションに統合できます。

仕組み

このライブラリは、Whisper の C++ 実装である whisper.cpp へのブリッジとして機能します。GGML モデルバイナリ(量子化バージョンを含む)のロードをサポートし、オーディオファイルまたは生の PCM データを文字起こしするための非同期 API を提供します。また、Silero VAD モデルを介した音声活動検知 (VAD) もサポートしており、オーディオ内の音声セグメントを特定できます。

対象者

iOS および Android アプリにおいて、オフライン、プライバシー保護、低遅延の文字起こし、またはリアルタイムの音声文字起こし機能を実装する必要がある React Native を使用したモバイル開発者。

ハイライト

  • マルチモデル対応: OpenAI の Whisper と NVIDIA Parakeet TDT モデルの両方をサポート。
  • リアルタイム文字起こし: VAD と自動スライス機能を統合した、ストリーミングオーディオ文字起こし用の RealtimeTranscriber を搭載。
  • ハードウェアアクセラレーション: iOS デバイスでの推論を高速化するための Core ML をサポート。
  • VAD 統合: ファイル、URL、または生データから音声セグメントを検出するための Silero VAD を内蔵。
  • 柔軟なアセット管理: モデルやオーディオファイルは、ローカルファイルシステムからロードするか、アプリのアセットとしてバンドルできます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト