nyrahealth/CrisperWhisper
Controllable Transcription. Verbatim ( every, filler, pause, stutter, vocal sound) , or intended ( what the speaker meant to say, optimized for readability) with word-level timestamps.
何を解決するか
CrisperWhisper 2.0 は高精度で、原文通りの音声認識を提供します。標準的な ASR システムでは、話された内容を正確に(詰まりや間の言葉を含めて)記録するか、意図された意味(クリーンなテキスト)に変換するかの判断が一貫性に欠ける問題があります。また、単語のタイミングの不正確さ、長時間音声におけるチャンク境界のアーティファクト、ループする幻覚といった一般的な ASR の問題も解決します。
動作方法
本システムは、高速化のための予測的デコードを備えた CTranslate2 ランタイムを使用し、幻覚を軽減する専用デコーダーを採用しています。正確な単語レベルのタイミングを実現するために、教師付きクロスアテンションのアライメントを用いています。長時間音声処理には「条件付き継続(conditional continuation)」を用いて、音声の各ウィンドウ間で滑らかな遷移を確保しています。また、「Verbatimize」機能により、クリーンなトランスクリプトと音声ファイルを入力として、実際の記録に含まれる不順な発話(発話の詰まりなど)を挿入することが可能です。
対象ユーザー
臨床的発話分析、TTSデータセット構築、または制御可能なスタイル(原文通り vs. 意図された内容)が必要なプロダクションレベルの ASR に必要な開発者や研究者向けです。
主な特徴
- 二重モードトランスクリプション:「原文通り」(間の言葉や詰まりを含む)と「意図された内容」(クリーンでフォーマットされたテキスト)の明示的な切り替えが可能。
- 高精度のタイミング:読み上げ音声において単語境界誤差が最低29.6msまで低下。
- Verbatimize:音声から実際の発話イベントを抽出し、クリーンなトランスクリプトを原文通りのものに変換。
- シームレスな長文処理:ウィンドウ境界で単語の重複や欠落が発生せず、任意の長さの音声を処理可能。
- プロダクション対応:予測的デコードにより1.3~1.4倍の高速化を実現し、内蔵された幻覚抑制機能も備えています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト