transcribe.cpp: 高性能なC/C++音声認識推論ライブラリで、数十のモデルファミリーとGPUアクセラレーションをサポート
transcribe.cpp: 高性能なC/C++音声認識推論ライブラリで、数十のモデルファミリーとGPUアクセラレーションをサポート
What it solves
transcribe.cppは、さまざまなハードウェアプラットフォームで多様なモデルファミリーを実行するように設計された高性能なC/C++音声認識(STT)推論ライブラリです。ハードウェアアクセラレーションを使って転写モデルを実行する統一された方法を提供し、重いフレームワークへの依存を減らしながら高い精度(WERテスト済み)を維持します。
How it works
このライブラリは、推論を行うためにggmlランタイムとGGUFモデルフォーマットを使用します。Metal(Apple Silicon)、Vulkan(Linux/Windows)、CUDA(NVIDIA)など、高速なGPUアクセラレーションのための複数のハードウェアバックエンドをサポートし、さらにtinyBLASで加速されたCPUパスも提供します。また、NVIDIA NeMoチェックポイントをGGUFに変換し、モデルを量子化してサイズを削減するツール(例えば、Q4_K_M、Q8_0)も含まれています。
Who it’s for
異なるオペレーティングシステムとハードウェアでアプリケーションに高速なローカル音声認識機能を統合する必要がある開発者、およびASRモデル用の軽量でポータブルな推論エンジンを探している人向けです。
Highlights
- 広範なモデルサポート: 16のモデルファミリーと60以上のバリアントをサポートし、Whisper、Parakeet、Canary、Qwen3-ASRなどを含みます。
- クロスプラットフォームアクセラレーション: Metal、Vulkan、CUDAバックエンドのネイティブサポート。
- 高い忠実度: 公開されたすべてのモデルは数値的に検証され、参照実装と比較してWord Error Rate(WER)テストが行われています。
- マルチランゲージバインディング: Python、TypeScript/JavaScript、Rust、Swift向けの公式バインディングが利用可能です。
- 柔軟な推論: ストリーミングとバッチ転写の両方をサポートします。 }