salute-developers/GigaAM
Foundational Model for Speech Recognition Tasks
解决的问题
GigaAM 提供了一组开源声学模型,专为高性能语音处理而设计。它解决了对俄语以及若干低资源语言(如哈萨克语、吉尔吉斯语和乌兹别克语)的最先进(SoTA)自动语音识别(ASR)和情感识别的需求。
工作原理
它使用基于 Conformer 的基础模型(参数量从 2.2 亿到 6 亿不等),在巨量语音数据上进行预训练——多语言版本最多达到 200 万小时。该系统采用多种解码策略,包括连接时序分类(CTC)和循环神经网络转换器(RNNT),将音频转换为文本。它还支持自监督学习(SSL)骨干网络用于音频嵌入提取,并提供专门用于情感检测的模型。
适用人群
从事语音转文本应用、情感分析和多语言音频处理的开发者和研究人员,特别是针对俄语地区或低资源语言的项目。
主要亮点
- 多语言支持:在 70 多种语言上进行预训练,在俄语、哈萨克语、吉尔吉斯语和乌兹别克语上表现优异。
- 端到端 ASR:包含
v3_e2e模型,支持标点符号和文本规范化,在与 Whisper-large-v3 的并列对比中表现更优。 - 部署灵活性:支持 ONNX 导出,实现更快的 GPU 推理,并可与 Triton Inference Server 和 TensorRT 集成。
- 多功能任务:支持音频嵌入提取、单词级时间戳,以及通过外部语音活动检测(VAD)实现长文本转录。
- 可微调:可使用 PyTorch Lightning 在自定义数据集上对模型进行微调。
相关
- 项目
- 项目
- Dispatch
- 项目
- Dispatch