nyrahealth/CrisperWhisper

Controllable Transcription. Verbatim ( every, filler, pause, stutter, vocal sound) , or intended ( what the speaker meant to say, optimized for readability) with word-level timestamps.

解決的問題

CrisperWhisper 2.0 提供高精度、原文直錄的語音轉文字。它解決了標準 ASR 系統在是否應精確轉錄所說內容(包括結巴和填充詞)或轉錄意圖內容(乾淨文字)之間缺乏一致性的難題。同時,它還解決了常見的 ASR 問題,如詞級時間戳不準確、長音頻中分塊邊界偽影,以及循環幻覺。

工作原理

該系統使用 CTranslate2 運行時配合推測性解碼以提升速度,並採用專用解碼器來減輕幻覺。透過監督式交叉注意力對齊實現精確的詞級時間戳。對於長音頻,使用「條件續接」技術確保轉錄窗口之間的無縫過渡。此外,還包含「Verbatimize」功能,可將乾淨的轉錄文本與音頻檔案結合,插入錄音中實際存在的不流暢語音事件。

適用人群

需要精確、逐字轉錄的開發者和研究人員,適用於臨床語音分析、TTS 數據集建構,或在生產級 ASR 中需要可控風格(原文直錄 vs. 意圖內容)的場景。

主要亮點

  • 雙模式轉錄:可明確在「原文直錄」(包含填充詞和結巴)與「意圖內容」(乾淨、格式化文字)之間切換。
  • 高精度時間戳:在朗讀語音中,詞邊界誤差低至 29.6ms。
  • Verbatimize:透過從音頻中提取真實語音事件,將乾淨轉錄升級為原文直錄版本。
  • 無縫長音頻處理:可處理任意長度音頻,窗口邊界處無重複或遺漏詞。
  • 生產就緒:支援推測性解碼,實現 1.3–1.4 倍加速,並內建幻覺抑制機制。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案