Granite Speech 5.0 Turbo CTC 릴리스 노트 / 새로운 기능

Hugging Face와 IBM은 극도의 속도와 높은 정확도를 위해 설계된 470M-파라미터 영어 음성 인식 모델 쌍인 Granite Speech 5.0 Turbo CTC를 출시했습니다. 이 모델들은 NVIDIA H200 GPU에서 12,600 RTFx 이상의 처리량을 달성할 수 있으며, 배치 추론을 사용하여 단 1초 만에 3.5시간 이상의 음성을 전사할 수 있습니다.

모델 변형 및 라이선스

다양한 라이선스 및 데이터 요구 사항을 충족하기 위해 두 가지 버전의 모델이 제공됩니다:

  • granite-speech-5.0-470m-turboctc: 더 작은 데이터셋으로 학습된 Apache 2.0 라이선스 모델입니다.
  • granite-speech-5.0-470m-turboctc-nc: 정확도 향상을 위해 추가 데이터로 학습된 CC-BY-NC-SA-4.0 라이선스의 비상업용 모델입니다.

성능 및 벤치마크

OpenASR Leaderboard의 공개 영어 단문 테스트 세트에서 얻은 비공식 결과에 따르면, 두 모델 모두 높은 정확도와 전례 없는 처리량을 보여줍니다:

  • 정확도: 비상업용(NC) 모델은 4.85%의 총 단어 오류율(WER)을 달성했으며, Apache 2.0 모델은 5.00%의 WER을 기록했습니다.
  • 처리량: 두 모델 모두 12,600 RTFx를 초과했습니다.
  • 비교 성능: NC 모델은 대부분의 테스트 세트에서 Apache 2.0 모델보다 우수한 성능을 보이며, SPGI Speech에서 상당한 이점을 보여주지만, chunked Earnings22 테스트에서는 성능이 더 낮습니다.

2026년 8월 25일 기준 FFASR Leaderboard의 공식 결과에 따르면, granite-speech-5.0-470m-turboctc-nc 모델은 정확도 부문에서 5위를 차지했으며 granite-speech-5.0-470m-turboctc 모델은 9위를 차지했습니다. 두 모델 모두 리더보드에서 가장 빠른 모델입니다.

모델 아키텍처

Granite Speech 5.0 Turbo CTC는 encoder-only 아키텍처를 사용하며, 이는 acoustic encoder를 projector와 paired하여 Granite LM과 LoRA adapter를 사용했던 이전 Granite Speech 모델들과는 다릅니다. 이 설계는 메모리 사용량을 470M 파라미터로 줄이고 이전 버전과 비교하여 처리량을 20배 이상 높였습니다.

기술 사양

  • 구조: 16개의 Conformer 블록 스택.
  • 최적화: 학습 중 Connectionist Temporal Classification (CTC) 손실 함수를 사용합니다.
  • 어텐션 메커니즘: 시퀀스 길이에 따른 이차 함수적 스케일링을 방지하기 위해 chunkwise attention을 사용합니다.
  • Self-Conditioning: 8번째 블록의 출력 부분에 구현되었습니다.

시간적 서브샘플링 (Temporal Subsampling)

토큰 비율을 초당 100프레임(log Mel spectrogram front end)에서 초당 12.5토큰으로 줄이기 위해, 모델은 3단계의 2x 서브샘플링을 사용합니다:

  1. 1단계: 연속적인 log Mel 특징 벡터를 reshape() 연산을 통해 쌓습니다.
  2. 2단계 및 3단계: 시간적 다운샘플링을 수행하기 위해 strided convolutions를 사용하여 처음 두 개의 Conformer 블록에 통합되었습니다.

토큰화 (Tokenization)

모델은 이전 인코더보다 낮은 토큰 비율로 작동합니다. granite-speech-5.0-470m-turboctc-nc 모델은 SentencePiece 토큰화를 사용하며, granite-speech-5.0-470m-turboctc 모델은 BPE 토큰화를 사용합니다. 두 토큰화 도구 모두 음성 전사 데이터로 특화되어 학습되었습니다.

학습 데이터

학습에는 자연 데이터와 합성 데이터가 혼합되었습니다. 두 모델 모두 다음 자연 데이터셋을 사용하여 학습되었습니다:

Dataset Hours Source
MLS 44,600 Multilingual LibriSpeech
YODAS 8,900 ESPnet YODAS
CommonVoice-17 2,500 Mozilla Common Voice 17.0
Librispeech 960 OpenSLR LibriSpeech ASR
VoxPopuli 500 Facebook VoxPopuli
AMI 150 Edinburgh CSTR AMI
Earnings-22 100 ESB Datasets

비상업용(NC) 모델은 GigaSpeech (10,000시간) 및 SPGI Speech (4,900시간)에 대해 추가 학습을 진행했습니다.

또한, 두 모델 모두 세 가지 합성 데이터셋을 사용하여 학습되었습니다:

  1. Multi-speaker concatenation (General): MLS, YODAS, CommonVoice-17, VoxPopuli, AMI에서 생성된 2,000시간.
  2. Multi-speaker concatenation (Earnings-22): Earnings-22에서 생성된 500시간.
  3. Targeted Utterances: gpt-oss-120b 또는 gpt-oss-20b를 통해 생성되고 StyleTTS2를 사용하여 합성된 숫자, 통화, 주소 데이터 240시간.

사용법 및 구현

Granite Speech 5.0 Turbo CTC는 transformers 라이브러리에서 기본적으로 지원됩니다. 사용자는 Hugging Face 생태계의 AutoModelForCTCAutoProcessor를 사용하여 모델을 구현할 수 있습니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • 프로젝트
  • Dispatch