linto-ai/whisper-timestamped

Multilingual Automatic Speech Recognition with word-level timestamps and confidence

何を解決するか

OpenAIのWhisperモデルは高品質な多言語音声認識を提供しますが、正確な単語レベルのタイムスタンプを備えていません。通常、1秒程度の精度で概算のセグメントレベルのタイミングしか提供しません。whisper-timestampedは、正確な単語タイムスタンプを予測し、音声セグメントのより正確な推定を可能にすることで、この課題を解決します。

動作方法

このプロジェクトは、クロスアテンション重みに動的時系列歪み(DTW)を適用するアプローチを実装しています。これにより、各音声セグメントがデコードされた直後に、リアルタイムで単語を音声信号にアライメントできます。多くの場合、追加の推論ステップを必要としません。また、各単語およびセグメントに信頼度スコアを割り当てます。

対象ユーザー

字幕の正確な作成、音声とテキストの同期、複数言語での発話パターンの分析など、転写テキストに高精度のタイミングが必要な開発者や研究者向けです。

主な特徴

  • 単語レベルの精度: 個々の単語の正確な開始時刻と終了時刻を予測します。
  • 信頼度スコア: 各単語およびセグメントに信頼度スコアを割り当てます。
  • メモリ効率: 標準のWhisperと比較して、追加のメモリオーバーヘッドが最小限に抑えられ、長時間の音声ファイルを処理できるように設計されています。
  • VAD統合: SileroやAuditokを介して音声活動検出(VAD)をサポートし、沈黙期間中の誤検出(ホールーシュレーション)を防ぎます。
  • 多言語対応: openai-whisperの任意のバージョンと互換性があり、Hugging Face Hubのファインチューニング済みモデルもサポートしています。

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト
  • Dispatch