netease-youdao/Confucius4-R2T2

Confucius4-R2T2: A Low Latency and High Accuracy Real-Time Speech Recognition Model

解決する課題

Confucius4-R2T2 は、低遅延かつ高精度なリアルタイム自動音声認識(ASR)を実現するという課題に取り組みます。具体的には、多くのストリーミングASRシステムで一般的な「視覚的なちらつき」や、テキストの修正による混乱を、追記専用(append-only)の出力モードを使用することで解決します。このモードでは、出力されたテキストは永続的に確定され、修正されることはありません。

仕組み

R2T2 は Qwen3-ASR モデルを基盤とし、最長安定プレフィックス(LSP)学習パラダイムを採用しています。これにより、モデルはテキストのセグメント(安定プレフィックス)が追加の音声コンテキストを必要とせずに安全に出力できるタイミングを動的に判断できます。これを達成するために、安定プレフィックスデータ、強制時間アライメントデータ、トークンレベルの音声セグメンテーションなどの専門的なデータ構築技術を使用してトレーニングされました。また、遅延と精度のトレードオフを調整できるよう、80ミリ秒から2秒までの設定可能なデコードチャンクをサポートしています。

対象ユーザー

このプロジェクトは、即時かつ安定したテキスト出力を必要とするアプリケーションを構築する開発者や研究者向けに設計されています。例:

  • リアルタイムのライブキャプションや字幕。
  • ダウンストリームのNLPパイプラインやLLMエージェント。
  • 同時音声翻訳システム。

主な特長

  • 真のストリーミング出力:追記専用モードでテキストを出力し、以前に出力された単語が修正されないことを保証します。
  • 低遅延:平均遅延は200〜600ミリ秒。
  • 高精度:オフラインASRに近い認識品質を維持。
  • 柔軟な設定:80ミリ秒から2秒までのデコードチャンクをサポート。
  • 高スループット:vLLMバックエンドによる効率的な推論。
  • 多言語対応:中国語と英語に最適化され、他の多言語もサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト