Granite Speech 5.0 Turbo CTC 发布说明 / 新特性

Hugging Face 和 IBM 发布了 Granite Speech 5.0 Turbo CTC,这是一对拥有 470M 参数的英语语音识别模型,旨在实现极高的速度和准确度。这些模型在 NVIDIA H200 GPU 上可以实现超过 12,600 RTFx 的吞吐量,通过批处理推理,每秒钟可以转录超过 3.5 小时的语音。

模型变体与许可

提供两个版本的模型以适应不同的许可和数据需求:

  • granite-speech-5.0-470m-turboctc: 一个在较小数据集上训练的 Apache 2.0 许可模型。
  • granite-speech-5.0-470m-turboctc-nc: 一个非商业模型,采用 CC-BY-NC-SA-4.0 许可,通过在额外数据上进行训练以提高准确度。

性能与基准测试

根据 OpenASR Leaderboard 公开英语短篇测试集的非官方结果,两个模型都展示了极高的准确度和前所未有的吞吐量:

  • 准确度: 非商业 (NC) 模型实现了 4.85% 的综合字错率 (WER),而 Apache 2.0 模型的分数为 5.00% WER。
  • 吞吐量: 两个模型都超过了 12,600 RTFx。
  • 对比性能: NC 模型在大多数测试集中通常优于 Apache 2.0 模型,在 SPGI Speech 上表现出显著优势,尽管它在分块的 Earnings22 测试中表现较差。

模型架构

Granite Speech 5.0 Turbo CTC 采用了仅编码器 (encoder-only) 架构,这与之前使用声学编码器配对投影器以及带有 LoRA 适配器的 Granite LM 的 Granite Speech 模型不同。这种设计将内存占用减少到 470M 参数,并将吞吐量与之前的版本相比提高了 20 倍以上。

技术规格

  • 结构: 16 个 Conformer 块的堆叠。
  • 优化: 训练期间使用连接主义时间分类 (CTC) 损失。
  • 注意力机制: 采用分块注意力 (chunkwise attention) 以防止随序列长度呈二次方增长。
  • 自调节 (Self-Conditioning): 在第 8 个块的输出端实现。

时间下采样

为了将标记率 (token rate) 从每秒 100 帧 (log Mel 频谱图前端) 降低到每秒 12.5 个标记,模型采用了三个阶段的 2x 下采样:

  1. 第一阶段: 通过 reshape() 操作将连续的 log Mel 特征向量堆叠起来。
  2. 第二和第三阶段: 使用步长卷积 (strided convolutions) 集成到前两个 Conformer 块中,以执行时间下采样。

分词 (Tokenization)

模型的标记率比之前的编码器更低。granite-speech-5.0-470m-turboctc-nc 模型使用 SentencePiece 分词,而 granite-speech-5.0-470m-turboctc 模型使用 BPE 分词。两个分词器都是专门针对语音转录文本训练的。

训练数据

训练涉及自然数据集和合成数据集的混合。两个模型都在以下自然数据集上进行了训练:

| Dataset | Hours | Source | | :--- | :--- | :--- | | | MLS | 44,600 | Multilingual LibriSpeech | | YODAS | 8,900 | ESPnet YODAS | | CommonVoice-17 | 2,500 | Mozilla Common Voice 17.0 | | Librispeech | 960 | OpenSLR LibriSpeech ASR | | VoxPopuli | 500 | Facebook VoxPopuli | | AMI | 150 | Edinburgh CSTR AMI | | Earnings-22 | 100 | ESB Datasets |

非商业 (NC) 模型在 GigaSpeech (10,000 小时) 和 SPGI Speech (4,900 小时) 上接受了额外的训练。

此外,两个模型都在三个合成数据集上进行了训练:

  1. 多发言人拼接 (General): 由 MLS, YODAS, CommonVoice-17, VoxPopuli, 和 AMI 生成的 2,000 小时数据。
  2. 多发言人拼接 (Earnings-22): 由 Earnings-22 生成的 500 小时数据。
  3. 针对性话语 (Targeted Utterances): 通过 gpt-oss-120bgpt-oss-20b 生成并使用 StyleTTS2 合成的 240 小时数字、货币和地址数据。

使用与实现

Granite Speech 5.0 Turbo CTC 在 transformers 库中得到了原生支持。用户可以使用 Hugging Face 生态系统中的 AutoModelForCTCAutoProcessor 来实现该模型。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • 项目
  • Dispatch