CrispStrobe/CrispASR

C++ ggml runtime hub for multilingual ASR and TTS models: Cohere Transcribe, Parakeet TDT, Voxtral, Canary 1B v2, etc, plus universal forced alignment, and more

何を解決するか

CrispASRは、自動音声認識(ASR)およびテキストから音声への変換(TTS)のための統合的で高パフォーマンスなC++エンジンを提供します。複雑なPython環境やPyTorch、または異なるモデル用に複数の別々のバイナリを必要とせず、1つのポータブル実行可能ファイルで数十の最先端のオープンウェイト音声モデルを実行できます。

動作方法

whisper.cppの拡張として構築されたCrispASRは、ggml C++ランタイムを使用して広範なASRおよびTTSアーキテクチャを実行します。OpenAI Whisper、NVIDIA Parakeet、Mistral Voxtralなど、多数のバックエンドをサポートしており、GGUFモデルファイルから必要なバックエンドを自動検出できます。このエンジンは非常にポータブルで、WebAssemblyにコンパイル可能で、ブラウザ上でクライアント側で実行でき、Python、Rust、Dart、Goなど複数の言語のバインディングも提供しています。

対象ユーザー

Python依存関係のオーバーヘッドなしに、効率的かつオフラインで音声認識および音声合成を必要とする開発者やユーザー向けに設計されています。特に、Flutterアプリ「CrisperWeaver」のようなクロスプラットフォームアプリの開発や、HTTP API経由での音声サービスのデプロイに役立ちます。

特徴

  • 膨大なモデル対応: 1つのバイナリに54のASRバックエンドと52のTTSエンジンを含みます。
  • Python依存なし: pip installやPyTorchの必要なしに、スタンドアロンのC++バイナリとして動作します。
  • 高いポータビリティ: Windows、macOS、Linux、およびブラウザベースの使用を想定したWebAssemblyをサポートします。
  • 柔軟なデプロイ: CLI、統合HTTPサーバー、およびさまざまなプログラミング環境向けの言語バインディングを提供します。
  • ハードウェアアクセラレーション: CUDA、HIP、Vulkan、Metal GPUアクセラレーションをネイティブでサポートしています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト