TheStageAI/TheWhisper

Optimized Whisper models for streaming and on-device use

何を解決するか

TheWhisper は、自己ホスティングおよびデバイス内推論に最適化された、高パフォーマンスで低レイテンシの音声認識(STT)ソリューションを提供します。オリジナルのWhisperモデルが30秒の音声チャンクを必要とするという制限を克服し、静音を追加する必要なく、10秒、15秒、20秒、30秒の柔軟なチャンクサイズをサポートします。

仕組み

このプロジェクトは、オープンウェイトと専用の推論エンジンを備えた、Whisperモデルのファインチューニング版を提供しています。異なるハードウェア向けに最適化されています:

  • NVIDIA GPU:TheStage AI ElasticModels を含む最適化されたエンジンを使用し、L40s GPUで220 tok/sの高いスループットを実現します。
  • Apple Silicon:CoreML および MLX エンジンを使用して、消費電力(約2W)とRAM使用量(約2GB)を最小限に抑えます。
  • ストリーミング:NVIDIAおよびmacOSプラットフォームの両方でストリーミング音声認識を実装し、リアルタイムアプリケーションをサポートします。

対象ユーザー

リアルタイム字幕、ライブ会議ツール、音声インターフェース、低消費電力と低レイテンシが求められるエッジデプロイメントを構築する開発者向けに設計されています。

主な特徴

  • 柔軟なチャンキング:10秒、15秒、20秒、30秒の音声チャンクをサポートし、より効率的な処理を実現します。
  • ハードウェア最適化:NVIDIA GPU(RTX 4090/5090、L40s、H100、A100)およびApple Silicon(M1-M4シリーズ)向けの専用高性能エンジンを備えています。
  • デバイス内デプロイ:Electron と ReactJS を使用したmacOSデスクトップアプリケーションの構築用のPython APIとサンプルを含んでいます。
  • ストリーミング対応:サポートされているプラットフォーム間で、組み込みのストリーミング音声認識を実現しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト