mybigday/whisper.rn
React Native binding of whisper.cpp.
解決する課題
whisper.rn は、高性能なデバイス上での自動音声認識 (ASR) を行うための React Native バインディングを提供します。これにより、開発者はクラウドベースの文字起こしサービスに依存することなく、OpenAI の Whisper および NVIDIA Parakeet モデルをモバイルアプリケーションに統合できます。
仕組み
このライブラリは、Whisper の C++ 実装である whisper.cpp へのブリッジとして機能します。GGML モデルバイナリ(量子化バージョンを含む)のロードをサポートし、オーディオファイルまたは生の PCM データを文字起こしするための非同期 API を提供します。また、Silero VAD モデルを介した音声活動検知 (VAD) もサポートしており、オーディオ内の音声セグメントを特定できます。
対象者
iOS および Android アプリにおいて、オフライン、プライバシー保護、低遅延の文字起こし、またはリアルタイムの音声文字起こし機能を実装する必要がある React Native を使用したモバイル開発者。
ハイライト
- マルチモデル対応: OpenAI の Whisper と NVIDIA Parakeet TDT モデルの両方をサポート。
- リアルタイム文字起こし: VAD と自動スライス機能を統合した、ストリーミングオーディオ文字起こし用の
RealtimeTranscriberを搭載。 - ハードウェアアクセラレーション: iOS デバイスでの推論を高速化するための Core ML をサポート。
- VAD 統合: ファイル、URL、または生データから音声セグメントを検出するための Silero VAD を内蔵。
- 柔軟なアセット管理: モデルやオーディオファイルは、ローカルファイルシステムからロードするか、アプリのアセットとしてバンドルできます。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト