Granite Speech 5.0 Turbo CTC 릴리스 노트 / 새로운 기능
Hugging Face와 IBM은 극도의 속도와 높은 정확도를 위해 설계된 470M-파라미터 영어 음성 인식 모델 쌍인 Granite Speech 5.0 Turbo CTC를 출시했습니다. 이 모델들은 NVIDIA H200 GPU에서 12,600 RTFx 이상의 처리량을 달성할 수 있으며, 배치 추론을 사용하여 단 1초 만에 3.5시간 이상의 음성을 전사할 수 있습니다.
모델 변형 및 라이선스
다양한 라이선스 및 데이터 요구 사항을 충족하기 위해 두 가지 버전의 모델이 제공됩니다:
granite-speech-5.0-470m-turboctc: 더 작은 데이터셋으로 학습된 Apache 2.0 라이선스 모델입니다.granite-speech-5.0-470m-turboctc-nc: 정확도 향상을 위해 추가 데이터로 학습된 CC-BY-NC-SA-4.0 라이선스의 비상업용 모델입니다.
성능 및 벤치마크
OpenASR Leaderboard의 공개 영어 단문 테스트 세트에서 얻은 비공식 결과에 따르면, 두 모델 모두 높은 정확도와 전례 없는 처리량을 보여줍니다:
- 정확도: 비상업용(NC) 모델은 4.85%의 총 단어 오류율(WER)을 달성했으며, Apache 2.0 모델은 5.00%의 WER을 기록했습니다.
- 처리량: 두 모델 모두 12,600 RTFx를 초과했습니다.
- 비교 성능: NC 모델은 대부분의 테스트 세트에서 Apache 2.0 모델보다 우수한 성능을 보이며, SPGI Speech에서 상당한 이점을 보여주지만, chunked Earnings22 테스트에서는 성능이 더 낮습니다.
2026년 8월 25일 기준 FFASR Leaderboard의 공식 결과에 따르면, granite-speech-5.0-470m-turboctc-nc 모델은 정확도 부문에서 5위를 차지했으며 granite-speech-5.0-470m-turboctc 모델은 9위를 차지했습니다. 두 모델 모두 리더보드에서 가장 빠른 모델입니다.
모델 아키텍처
Granite Speech 5.0 Turbo CTC는 encoder-only 아키텍처를 사용하며, 이는 acoustic encoder를 projector와 paired하여 Granite LM과 LoRA adapter를 사용했던 이전 Granite Speech 모델들과는 다릅니다. 이 설계는 메모리 사용량을 470M 파라미터로 줄이고 이전 버전과 비교하여 처리량을 20배 이상 높였습니다.
기술 사양
- 구조: 16개의 Conformer 블록 스택.
- 최적화: 학습 중 Connectionist Temporal Classification (CTC) 손실 함수를 사용합니다.
- 어텐션 메커니즘: 시퀀스 길이에 따른 이차 함수적 스케일링을 방지하기 위해 chunkwise attention을 사용합니다.
- Self-Conditioning: 8번째 블록의 출력 부분에 구현되었습니다.
시간적 서브샘플링 (Temporal Subsampling)
토큰 비율을 초당 100프레임(log Mel spectrogram front end)에서 초당 12.5토큰으로 줄이기 위해, 모델은 3단계의 2x 서브샘플링을 사용합니다:
- 1단계: 연속적인 log Mel 특징 벡터를
reshape()연산을 통해 쌓습니다. - 2단계 및 3단계: 시간적 다운샘플링을 수행하기 위해 strided convolutions를 사용하여 처음 두 개의 Conformer 블록에 통합되었습니다.
토큰화 (Tokenization)
모델은 이전 인코더보다 낮은 토큰 비율로 작동합니다. granite-speech-5.0-470m-turboctc-nc 모델은 SentencePiece 토큰화를 사용하며, granite-speech-5.0-470m-turboctc 모델은 BPE 토큰화를 사용합니다. 두 토큰화 도구 모두 음성 전사 데이터로 특화되어 학습되었습니다.
학습 데이터
학습에는 자연 데이터와 합성 데이터가 혼합되었습니다. 두 모델 모두 다음 자연 데이터셋을 사용하여 학습되었습니다:
| Dataset | Hours | Source |
|---|---|---|
| MLS | 44,600 | Multilingual LibriSpeech |
| YODAS | 8,900 | ESPnet YODAS |
| CommonVoice-17 | 2,500 | Mozilla Common Voice 17.0 |
| Librispeech | 960 | OpenSLR LibriSpeech ASR |
| VoxPopuli | 500 | Facebook VoxPopuli |
| AMI | 150 | Edinburgh CSTR AMI |
| Earnings-22 | 100 | ESB Datasets |
비상업용(NC) 모델은 GigaSpeech (10,000시간) 및 SPGI Speech (4,900시간)에 대해 추가 학습을 진행했습니다.
또한, 두 모델 모두 세 가지 합성 데이터셋을 사용하여 학습되었습니다:
- Multi-speaker concatenation (General): MLS, YODAS, CommonVoice-17, VoxPopuli, AMI에서 생성된 2,000시간.
- Multi-speaker concatenation (Earnings-22): Earnings-22에서 생성된 500시간.
- Targeted Utterances:
gpt-oss-120b또는gpt-oss-20b를 통해 생성되고StyleTTS2를 사용하여 합성된 숫자, 통화, 주소 데이터 240시간.
사용법 및 구현
Granite Speech 5.0 Turbo CTC는 transformers 라이브러리에서 기본적으로 지원됩니다. 사용자는 Hugging Face 생태계의 AutoModelForCTC와 AutoProcessor를 사용하여 모델을 구현할 수 있습니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- 프로젝트
- Dispatch