netease-youdao/Confucius4-R2T2

Confucius4-R2T2: A Low Latency and High Accuracy Real-Time Speech Recognition Model

解決的問題

Confucius4-R2T2 解決了建立即時自動語音辨識(ASR)時,同時具備低延遲與高準確率的挑戰。具體而言,它透過僅追加(append-only)的輸出模式,解決了許多串流 ASR 系統中常見的「視覺閃爍」與干擾性文字修正問題,其中已輸出的文字會被永久保留,不會被修改。

運作方式

R2T2 基於 Qwen3-ASR 模型,採用最長穩定前綴(LSP)學習範式。這使模型能動態判斷何時可以安全地輸出文字片段(穩定前綴),而無需等待更多音訊內容。為達成此目標,它使用了專門的資料建構技術進行訓練,包括穩定前綴資料、強制時間對齊資料,以及 token 級音訊分割。它支援可設定的解碼區塊,範圍從 80 毫秒到 2 秒,讓使用者能平衡延遲與準確率之間的取捨。

適用對象

此專案專為需要即時、穩定文字輸出的開發者與研究人員設計,例如:

  • 即時直播字幕與標題。
  • 下游 NLP 管線與 LLM 代理。
  • 同步語音翻譯系統。

重點特色

  • 真正的串流輸出:以僅追加模式輸出文字,確保先前輸出的詞彙不會被修改。
  • 低延遲:平均延遲介於 200 至 600 毫秒之間。
  • 高準確率:維持接近離線 ASR 的辨識品質。
  • 彈性設定:支援 80 毫秒至 2 秒的解碼區塊。
  • 高吞吐量:由 vLLM 後端驅動,提供高效推論。
  • 多語言:針對中文與英文最佳化,並支援其他多種語言。

相關

  • 專案
  • 專案
  • 專案
  • 專案