NVIDIA Nemotron 3 音声話者分離 100Mパラメータモデルのリリース

TL;DR

NVIDIAは、最大8人の話者をサポートし、VoiceArenaのDiarization‑Benchで14.72 %の音声話者分離誤差率(DER)を達成し、1位にランクインする100 MパラメータのTransformerモデルであるオープンウェイトのNemotron‑3 Diarizationモデルを発表しました。このモデルはオフラインおよびリアルタイムストリーミングの両方のユースケースに対応しています。


話者分離の重要性

話者分離は、音声トランスクリプトに「誰がいつ話したか」の情報を追加します。話者を特定しないと、発言、反論、遮断などの内容を正しい参加者に結びつけることができず、検索、要約、アクションアイテム抽出、音声エージェントの記憶機能が制限されます。

モデル概要と性能

  • モデルサイズ: 100 Mパラメータ、Hugging Faceにオープンウェイトのチェックポイントを公開。
  • 話者対応数: 最大8人の匿名話者チャンネルをサポート。
  • 順位: VoiceArenaのDiarization‑Benchで12システム・17構成のうち1位(DER 14.72 %)。
  • レイテンシーオプション: 入力バッファレイテンシーが30.4 s(オフラインスタイル)、1.04 s、0.64 s、0.32 s。
  • スループット: 30.4 sレイテンシー(バッチサイズ32、BF16、torch.compile)で15,113×リアルタイム係数(RTFx)を達成。前回の4話者Sortformerベースラインの2,619×を上回る。

アーキテクチャと推論フロー

  1. 音声前処理 – 16 kHzモノラル音声 → 10 msフレームステップのMelスペクトログラムに変換。8回スタックして80 msフレームを生成。
  2. Transformerエンコーダ – 31層のTransformerで回転位置埋め込み(RoPE)を使用。
  3. Conv1Dアップサンプラー – 予測を元の特徴解像度に戻す。
  4. 出力テンソル – 形状 [T, 8]。各列は時刻Tにおける話者チャンネルがアクティブである確率(デフォルト10 msストライド)。
  5. ストリーミングメモリ –
    • 到着順話者キャッシュ(AOSC) は、チャンク間で話者埋め込みを保持し、初出順に並べる。
    • FIFOキュー は最近のフレーム情報を供給。
  6. 右側コンテキストバッファリング – 遷移処理を改善するための未来音声を提供。レイテンシーと精度のトレードオフを設定可能。

このモデルはSortformerの原則に従います。話者は到着順に並べられ、安定した汎用ラベル(speaker_0、speaker_1、…)を提供し、各チャンクごとの順列解決を不要にします。

学習データとライセンス付きソースの影響

学習には公開音声コーパスに加え、David AIのライセンス付きマルチ話者会話データを使用。David AIデータの追加により、オフラインおよび超低レイテンシー動作点で複合DERが0.77パーセンテージポイント(11.19 % → 10.42 %)低下しました。

オフライン vs ストリーミング話者分離

  • オフライン: モデルは全録音を一度に見ることができ、話者の割り当てにグローバルコンテキストを利用可能。
  • ストリーミング: モデルは固定サイズのチャンクを処理し、左/右コンテキストが限られる。AOSCとFIFOに依存してチャンク間で話者アイデンティティを維持。同じチェックポイントが両モードで使用可能で、デプロイを簡素化。

ベンチマーク結果と相対的改善

データセット(サブセット) ベースラインDER Nemotron‑3 DER 相対的低下率
VoiceArena(全体) 19.3 % 14.72 % ~24 %
DIHARD III(全) 19.09 % 12.73 % 33 %
CALLHOME‑Part2(1.04 s) 10.32 % 9.10 % 12 %
NOTSOFAR1 MHM(1.04 s) 27.5 % 9.6 % 65 %

8つの評価条件において、1.04秒レイテンシーでの未加重平均相対DER低下率は**41 %**です。話者数が多いサブセット(5人以上)では改善が大きく、すべてのレイテンシーセットで一貫性があります。

正確性 vs スループットのトレードオフ

  • 30.4 sバッファ: 15,113× RTFx、DER 12.73 %(DIHARD III)
  • 1.04 sバッファ: 865× RTFx、DER 13.18 %(DIHARD III)
  • 0.32 sバッファ: 最低レイテンシーだが、DERは若干上昇。それでも前回のSortformerベースラインを上回る。

開発者は、ターゲットハードウェア上で音声I/O、話者分離、ASR、および下流処理を含むエンドツーエンドレイテンシーをベンチマークすべきです。

話者属性付きASRとの統合

話者分離は各話者チャンネルのタイムスタンプを提供。ASRは単語レベルのタイムスタンプを提供。単純な中点一致ヒューリスティックで各単語をアクティブな話者にマッピングできます:

midpoint = (word['start'] + word['end']) / 2
label = speaker_at(midpoint)

本番環境のトランスクリプトには、より洗練されたオーバーラップ処理が必要な場合があります。

デプロイに関する考慮事項

  • 話者制限: モデルは最大8人の同時話者をサポート。これを超えると、話者の漏れや誤分類が発生する可能性があります。
  • 音響耐性: 重度のノイズ、残響、遠方収音、ドメインシフトは性能を低下させる可能性があります。
  • 不確実性の扱い: 下流システムは割り当てを絶対と見なさず、信頼スコアを保持すべきです。
  • ライセンス: 使用はOpenMDW License v1.1に準拠。

NVIDIA NeMo Speechの導入方法

apt-get update && apt-get install -y libsndfile1 ffmpeg
uv pip install Cython packaging
uv pip install 'nemo-toolkit[asr]'
from nemo.collections.asr.models import SortformerEncLabelModel

diarmodel = SortformerEncLabelModel.from_pretrained(
    "nvidia/Nemotron-3-Diarization"
)
diarmodel.eval()
# 1.04 sレイテンシー用のストリーミングパラメータの例

diarmodel.sortformer_modules.spkcache_len = 264
ndiarmodel.sortformer_modules.fifo_len = 40
ndiarmodel.sortformer_modules.chunk_len = 9   # 720 ms
ndiarmodel.sortformer_modules.chunk_right_context = 4
ndiarmodel._check_streaming_parameters()

segments = diarmodel.diarize(["/path/to/conversation.wav"], batch_size=1)
print(segments)

diarize()メソッドは話者ラベル付きのセグメント(start end speaker_id)を返します。include_tensor_outputs=Trueを設定すると、生の確率テンソルも取得できます。

リアルタイムデモとエコシステムサポート

  • ライブデモ: https://huggingface.co/spaces/nvidia/nemotron-diarization – 8話者合成会話、ライブマイク入力、多言語ストリームをサポート。
  • Argmax Pro SDK 3: 最大8話者までのデバイス内リアルタイム話者属性付与と、事前に話者分離済みのトランスクリプションAPIを提供。
  • パートナーデプロイ: Baseten、DigitalOcean、Argmaxが本番環境推論、スケーリング、モバイル統合のパスを提供。

リソース

  • モデルカード: https://huggingface.co/nvidia/Nemotron-3-Diarization
  • VoiceArena Diarization‑Bench ランキング
  • Argmax Pro SDK 3 発表
  • NVIDIA NeMo Speech リポジトリ
  • Sortformer論文(arXiv:2409.06656)およびStreaming Sortformer論文(arXiv:2507.18446)
  • 話者分離+ASR統合のクイックスタートガイド
  • インタラクティブデモスペース

意味

Nemotron‑3 Diarizationは、1つの比較的小さな(100 M)Transformerモデルが、8人の話者に対して最先端の話者属性精度を実現しつつ、広範なレイテンシーバジェットをサポートできることを示しています。これにより、会議、コールセンター分析、ポッドキャスト、デバイス内音声アシスタントにおけるリアルタイム・マルチ話者トランスクリプションの障壁が低下し、今後の話者分離研究および製品化の新しい基準を確立しました。

Sources