nyrahealth/CrisperWhisper
Controllable Transcription. Verbatim ( every, filler, pause, stutter, vocal sound) , or intended ( what the speaker meant to say, optimized for readability) with word-level timestamps.
해결하는 문제
CrisperWhisper 2.0은 고정밀도로 원문 그대로의 음성-텍스트 변환을 제공합니다. 일반적인 ASR 시스템은 말한 내용을 정확히(말의 막힘과 중간 말투를 포함해) 기록할지, 아니면 의도된 의미(클린 텍스트)로 변환할지를 일관성 있게 결정하지 못하는 문제가 있습니다. 또한 단어 타이밍의 부정확성, 긴 오디오에서의 청크 경계 아티팩트, 반복적 환각 같은 일반적인 ASR 문제도 해결합니다.
작동 방식
시스템은 속도를 높이기 위해 CTranslate2 런타임과 예측적 디코딩을 사용하며, 환각을 완화하기 위한 특화된 디코더를 채택합니다. 정밀한 단어 수준 타이밍을 달성하기 위해 감독된 크로스 어텐션 어라이먼트를 활용합니다. 긴 오디오 처리를 위해 '조건부 연속성(conditional continuation)'을 사용하여 전사 창 간의 원활한 전환을 보장합니다. 또한 'Verbatimize' 기능을 통해 클린 전사본과 오디오 파일을 입력으로 받아 실제 녹음에 포함된 불순한 발화를 삽입할 수 있습니다.
대상 사용자
임상적 발화 분석, TTS 데이터셋 구축, 또는 제어 가능한 스타일(원문 대로 vs. 의도된 내용)이 필요한 프로덕션 수준의 ASR을 필요로 하는 개발자 및 연구자에게 적합합니다.
주요 특징
- 이중 모드 전사: '원문 대로'(중간 말투와 말의 막힘 포함)와 '의도된 내용'(클린, 포맷된 텍스트) 간 명시적으로 전환 가능.
- 고정밀 타이밍: 독백 음성에서 단어 경계 오류가 최소 29.6ms까지 감소.
- Verbatimize: 실제 오디오에서의 발화 이벤트를 추출하여 클린 전사본을 원문 대로 전사본으로 업그레이드.
- 무결점 장문 처리: 창 경계에서 단어가 중복되거나 누락되지 않으며, 길이 제한 없이 오디오 전사 가능.
- 프로덕션 준비 완료: 예측적 디코딩으로 1.3~1.4배의 속도 향상과 내장된 환각 완화 기능을 제공.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트