NVIDIA Nemotron 3 音声話者分離 100Mパラメータモデルのリリース
TL;DR
NVIDIAは、最大8人の話者をサポートし、VoiceArenaのDiarization‑Benchで14.72 %の音声話者分離誤差率(DER)を達成し、1位にランクインする100 MパラメータのTransformerモデルであるオープンウェイトのNemotron‑3 Diarizationモデルを発表しました。このモデルはオフラインおよびリアルタイムストリーミングの両方のユースケースに対応しています。
話者分離の重要性
話者分離は、音声トランスクリプトに「誰がいつ話したか」の情報を追加します。話者を特定しないと、発言、反論、遮断などの内容を正しい参加者に結びつけることができず、検索、要約、アクションアイテム抽出、音声エージェントの記憶機能が制限されます。
モデル概要と性能
- モデルサイズ: 100 Mパラメータ、Hugging Faceにオープンウェイトのチェックポイントを公開。
- 話者対応数: 最大8人の匿名話者チャンネルをサポート。
- 順位: VoiceArenaのDiarization‑Benchで12システム・17構成のうち1位(DER 14.72 %)。
- レイテンシーオプション: 入力バッファレイテンシーが30.4 s(オフラインスタイル)、1.04 s、0.64 s、0.32 s。
- スループット: 30.4 sレイテンシー(バッチサイズ32、BF16、torch.compile)で15,113×リアルタイム係数(RTFx)を達成。前回の4話者Sortformerベースラインの2,619×を上回る。
アーキテクチャと推論フロー
- 音声前処理 – 16 kHzモノラル音声 → 10 msフレームステップのMelスペクトログラムに変換。8回スタックして80 msフレームを生成。
- Transformerエンコーダ – 31層のTransformerで回転位置埋め込み(RoPE)を使用。
- Conv1Dアップサンプラー – 予測を元の特徴解像度に戻す。
- 出力テンソル – 形状
[T, 8]。各列は時刻Tにおける話者チャンネルがアクティブである確率(デフォルト10 msストライド)。 - ストリーミングメモリ –
- 到着順話者キャッシュ(AOSC) は、チャンク間で話者埋め込みを保持し、初出順に並べる。
- FIFOキュー は最近のフレーム情報を供給。
- 右側コンテキストバッファリング – 遷移処理を改善するための未来音声を提供。レイテンシーと精度のトレードオフを設定可能。
このモデルはSortformerの原則に従います。話者は到着順に並べられ、安定した汎用ラベル(speaker_0、speaker_1、…)を提供し、各チャンクごとの順列解決を不要にします。
学習データとライセンス付きソースの影響
学習には公開音声コーパスに加え、David AIのライセンス付きマルチ話者会話データを使用。David AIデータの追加により、オフラインおよび超低レイテンシー動作点で複合DERが0.77パーセンテージポイント(11.19 % → 10.42 %)低下しました。
オフライン vs ストリーミング話者分離
- オフライン: モデルは全録音を一度に見ることができ、話者の割り当てにグローバルコンテキストを利用可能。
- ストリーミング: モデルは固定サイズのチャンクを処理し、左/右コンテキストが限られる。AOSCとFIFOに依存してチャンク間で話者アイデンティティを維持。同じチェックポイントが両モードで使用可能で、デプロイを簡素化。
ベンチマーク結果と相対的改善
| データセット(サブセット) | ベースラインDER | Nemotron‑3 DER | 相対的低下率 |
|---|---|---|---|
| VoiceArena(全体) | 19.3 % | 14.72 % | ~24 % |
| DIHARD III(全) | 19.09 % | 12.73 % | 33 % |
| CALLHOME‑Part2(1.04 s) | 10.32 % | 9.10 % | 12 % |
| NOTSOFAR1 MHM(1.04 s) | 27.5 % | 9.6 % | 65 % |
8つの評価条件において、1.04秒レイテンシーでの未加重平均相対DER低下率は**41 %**です。話者数が多いサブセット(5人以上)では改善が大きく、すべてのレイテンシーセットで一貫性があります。
正確性 vs スループットのトレードオフ
- 30.4 sバッファ: 15,113× RTFx、DER 12.73 %(DIHARD III)
- 1.04 sバッファ: 865× RTFx、DER 13.18 %(DIHARD III)
- 0.32 sバッファ: 最低レイテンシーだが、DERは若干上昇。それでも前回のSortformerベースラインを上回る。
開発者は、ターゲットハードウェア上で音声I/O、話者分離、ASR、および下流処理を含むエンドツーエンドレイテンシーをベンチマークすべきです。
話者属性付きASRとの統合
話者分離は各話者チャンネルのタイムスタンプを提供。ASRは単語レベルのタイムスタンプを提供。単純な中点一致ヒューリスティックで各単語をアクティブな話者にマッピングできます:
midpoint = (word['start'] + word['end']) / 2
label = speaker_at(midpoint)
本番環境のトランスクリプトには、より洗練されたオーバーラップ処理が必要な場合があります。
デプロイに関する考慮事項
- 話者制限: モデルは最大8人の同時話者をサポート。これを超えると、話者の漏れや誤分類が発生する可能性があります。
- 音響耐性: 重度のノイズ、残響、遠方収音、ドメインシフトは性能を低下させる可能性があります。
- 不確実性の扱い: 下流システムは割り当てを絶対と見なさず、信頼スコアを保持すべきです。
- ライセンス: 使用はOpenMDW License v1.1に準拠。
NVIDIA NeMo Speechの導入方法
apt-get update && apt-get install -y libsndfile1 ffmpeg
uv pip install Cython packaging
uv pip install 'nemo-toolkit[asr]'
from nemo.collections.asr.models import SortformerEncLabelModel
diarmodel = SortformerEncLabelModel.from_pretrained(
"nvidia/Nemotron-3-Diarization"
)
diarmodel.eval()
# 1.04 sレイテンシー用のストリーミングパラメータの例
diarmodel.sortformer_modules.spkcache_len = 264
ndiarmodel.sortformer_modules.fifo_len = 40
ndiarmodel.sortformer_modules.chunk_len = 9 # 720 ms
ndiarmodel.sortformer_modules.chunk_right_context = 4
ndiarmodel._check_streaming_parameters()
segments = diarmodel.diarize(["/path/to/conversation.wav"], batch_size=1)
print(segments)
diarize()メソッドは話者ラベル付きのセグメント(start end speaker_id)を返します。include_tensor_outputs=Trueを設定すると、生の確率テンソルも取得できます。
リアルタイムデモとエコシステムサポート
- ライブデモ: https://huggingface.co/spaces/nvidia/nemotron-diarization – 8話者合成会話、ライブマイク入力、多言語ストリームをサポート。
- Argmax Pro SDK 3: 最大8話者までのデバイス内リアルタイム話者属性付与と、事前に話者分離済みのトランスクリプションAPIを提供。
- パートナーデプロイ: Baseten、DigitalOcean、Argmaxが本番環境推論、スケーリング、モバイル統合のパスを提供。
リソース
- モデルカード: https://huggingface.co/nvidia/Nemotron-3-Diarization
- VoiceArena Diarization‑Bench ランキング
- Argmax Pro SDK 3 発表
- NVIDIA NeMo Speech リポジトリ
- Sortformer論文(arXiv:2409.06656)およびStreaming Sortformer論文(arXiv:2507.18446)
- 話者分離+ASR統合のクイックスタートガイド
- インタラクティブデモスペース
意味
Nemotron‑3 Diarizationは、1つの比較的小さな(100 M)Transformerモデルが、8人の話者に対して最先端の話者属性精度を実現しつつ、広範なレイテンシーバジェットをサポートできることを示しています。これにより、会議、コールセンター分析、ポッドキャスト、デバイス内音声アシスタントにおけるリアルタイム・マルチ話者トランスクリプションの障壁が低下し、今後の話者分離研究および製品化の新しい基準を確立しました。