handy-computer/transcribe.cpp

ggml speech-to-text inference for 16+ model families

解決する課題

transcribe.cpp は、さまざまなハードウェアプラットフォーム上で多様なモデルファミリーを実行できるように設計された、高性能な C/C++ 音声認識 (STT) 推論ライブラリです。ストリーミングおよびバッチ処理の両方をサポートする軽量でポータブルなランタイムを提供することで、重い依存関係の必要性を排除します。

仕組み

このライブラリは、ggml ランタイムと GGUF モデル形式を使用して推論を実行します。Metal (Apple Silicon)、Vulkan (Linux/Windows)、および CUDA (NVIDIA GPUs) を介したハードウェアアクセラレーションを活用し、CPU向けには tinyBLAS で加速されたパスを提供します。モデルサイズを削減するための量子化ツールと、NVIDIA NeMo チェックポイントを GGUF 形式に変換するコンバーターが含まれています。

対象者

クラウド API や重い ML フレームワークに依存することなく、高速なローカル音声認識機能をアプリケーションに統合する必要がある開発者。Python、TypeScript/JavaScript、Rust、および Swift の公式バインディングを提供しています。

ハイライト

  • 幅広いモデルサポート: Whisper、Parakeet、Canary、Qwen3-ASR を含む 16 のモデルファミリーと 60 以上のバリアントをサポート。
  • クロスプラットフォーム加速: Metal、Vulkan、CUDA のネイティブ GPU サポート。
  • 数値検証済み: すべての公開モデルは、リファレンス実装に対して数値検証および WER テスト済みです。
  • 柔軟なデプロイ: 音声のストリーミング処理とバッチ処理の両方をサポート。
  • 量子化: より小さく効率的なモデルを作成するための組み込みツール (F16, Q8_0, Q4_K_M など)。