nyrahealth/CrisperWhisper

Controllable Transcription. Verbatim ( every, filler, pause, stutter, vocal sound) , or intended ( what the speaker meant to say, optimized for readability) with word-level timestamps.

何を解決するか

CrisperWhisper 2.0 は高精度で、原文通りの音声認識を提供します。標準的な ASR システムでは、話された内容を正確に(詰まりや間の言葉を含めて)記録するか、意図された意味(クリーンなテキスト)に変換するかの判断が一貫性に欠ける問題があります。また、単語のタイミングの不正確さ、長時間音声におけるチャンク境界のアーティファクト、ループする幻覚といった一般的な ASR の問題も解決します。

動作方法

本システムは、高速化のための予測的デコードを備えた CTranslate2 ランタイムを使用し、幻覚を軽減する専用デコーダーを採用しています。正確な単語レベルのタイミングを実現するために、教師付きクロスアテンションのアライメントを用いています。長時間音声処理には「条件付き継続(conditional continuation)」を用いて、音声の各ウィンドウ間で滑らかな遷移を確保しています。また、「Verbatimize」機能により、クリーンなトランスクリプトと音声ファイルを入力として、実際の記録に含まれる不順な発話(発話の詰まりなど)を挿入することが可能です。

対象ユーザー

臨床的発話分析、TTSデータセット構築、または制御可能なスタイル(原文通り vs. 意図された内容)が必要なプロダクションレベルの ASR に必要な開発者や研究者向けです。

主な特徴

  • 二重モードトランスクリプション:「原文通り」(間の言葉や詰まりを含む)と「意図された内容」(クリーンでフォーマットされたテキスト)の明示的な切り替えが可能。
  • 高精度のタイミング:読み上げ音声において単語境界誤差が最低29.6msまで低下。
  • Verbatimize:音声から実際の発話イベントを抽出し、クリーンなトランスクリプトを原文通りのものに変換。
  • シームレスな長文処理:ウィンドウ境界で単語の重複や欠落が発生せず、任意の長さの音声を処理可能。
  • プロダクション対応:予測的デコードにより1.3~1.4倍の高速化を実現し、内蔵された幻覚抑制機能も備えています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト