netease-youdao/Confucius4-R2T2
Confucius4-R2T2: A Low Latency and High Accuracy Real-Time Speech Recognition Model
解决的问题
Confucius4-R2T2 解决了建立实时自动语音识别(ASR)时,同时具备低延迟与高准确率的挑战。具体而言,它透过仅追加(append-only)的输出模式,解决了许多串流 ASR 系统中常见的「视觉闪烁」与干扰性文字修正问题,其中已输出的文字会被永久保留,不会被修改。
运作方式
R2T2 基于 Qwen3-ASR 模型,采用最长稳定前缀(LSP)学习范式。这使模型能动态判断何时可以安全地输出文字片段(稳定前缀),而无需等待更多音频内容。为达成此目标,它使用了专门的资料建构技术进行训练,包括稳定前缀资料、强制时间对齐资料,以及 token 级音频分割。它支援可设定的解码区块,范围从 80 毫秒到 2 秒,让使用者能平衡延迟与准确率之间的取舍。
适用对象
此专案专为需要即时、稳定文字输出的开发者与研究人员设计,例如:
- 即时直播字幕与标题。
- 下游 NLP 管线与 LLM 代理。
- 同步语音翻译系统。
重点特色
- 真正的串流输出:以仅追加模式输出文字,确保先前输出的词汇不会被修改。
- 低延迟:平均延迟介于 200 至 600 毫秒之间。
- 高准确率:维持接近离线 ASR 的辨识品质。
- 弹性设定:支援 80 毫秒至 2 秒的解码区块。
- 高吞吐量:由 vLLM 后端驱动,提供高效推理。
- 多语言:针对中文与英文最佳化,并支援其他多种语言。
相关
- 项目
- 项目
- 项目
- 项目