nyrahealth/CrisperWhisper
Controllable Transcription. Verbatim ( every, filler, pause, stutter, vocal sound) , or intended ( what the speaker meant to say, optimized for readability) with word-level timestamps.
解决的问题
CrisperWhisper 2.0 提供高精度、原文直录的语音转文字。它解决了标准 ASR 系统在是否应精确转录所说内容(包括结巴和填充词)或转录意图内容(干净文本)之间缺乏一致性的难题。同时,它还解决了常见的 ASR 问题,如词级时间戳不准确、长音频中分块边界伪影,以及循环幻觉。
工作原理
该系统使用 CTranslate2 运行时配合推测性解码以提升速度,并采用专用解码器来减轻幻觉。通过监督式交叉注意力对齐实现精确的词级时间戳。对于长音频,使用「条件续接」技术确保转录窗口之间的无缝过渡。此外,还包含「Verbatimize」功能,可将干净的转录文本与音频文件结合,插入录音中实际存在的不流畅语音事件。
适用人群
需要精确、逐字转录的开发者和研究人员,适用于临床语音分析、TTS 数据集构建,或在生产级 ASR 中需要可控风格(原文直录 vs. 意图内容)的场景。
主要亮点
- 双模式转录:可明确在「原文直录」(包含填充词和结巴)与「意图内容」(干净、格式化文本)之间切换。
- 高精度时间戳:在朗读语音中,词边界误差低至 29.6ms。
- Verbatimize:通过从音频中提取真实语音事件,将干净转录升级为原文直录版本。
- 无缝长音频处理:可处理任意长度音频,窗口边界处无重复或丢失词。
- 生产就绪:支持推测性解码,实现 1.3–1.4 倍加速,并内置幻觉抑制机制。
相关
- 项目
- 项目
- 项目
- 项目
- 项目