NVIDIA Nemotron 3 음성 분리 100M 파라미터 모델 출시
TL;DR
NVIDIA는 오픈웨이트 Nemotron-3 음성 분리 모델을 발표했습니다. 이 모델은 최대 8명의 화자까지 지원하는 1억 파라미터 트랜스포머로, 음성 분리 오류율(DER)이 14.72%로 VoiceArena의 Diarization-Bench에서 1위를 기록하며 오프라인 및 실시간 스트리밍 사용 사례 모두에서 작동합니다.
화자 분리가 중요한 이유
화자 분리는 음성 전사에 "누가 언제 말했는지"라는 정보를 추가합니다. 화자 할당 없이는 전사본이 발언, 반대 의견, 중단 등을 올바른 참여자와 연결할 수 없어 검색, 요약, 작업 항목 추출, 음성 에이전트 메모리 기능이 제한됩니다.
모델 개요 및 성능
- 모델 크기: 1억 파라미터, Hugging Face에 오픈웨이트 체크포인트 제공.
- 화자 용량: 최대 8명의 익명 화자 채널 지원.
- 리더보드 순위: VoiceArena의 Diarization-Bench에서 12개 시스템, 17개 구성 중 1위 (DER 14.72%).
- 지연 시간 옵션: 입력 버퍼 지연 시간이 30.4초(오프라인 스타일), 1.04초, 0.64초, 0.32초.
- 처리량: 30.4초 지연 시 배치 크기 32, BF16, torch.compile 사용 시 15,113× 실시간 요소(RTFx)이며, 이전 4명 화자 Sortformer 베이스라인의 2,619×보다 뛰어납니다.
아키텍처 및 추론 흐름
- 오디오 전처리 – 16kHz 모노 오디오 → 10ms 프레임 간격의 멜스펙트로그램으로 변환, 8배 스택하여 80ms 프레임 생성.
- 트랜스포머 인코더 – 31층 트랜스포머, 회전 위치 임베딩(RoPE) 사용.
- Conv1D 업샘플러 – 예측을 원본 특징 해상도로 복원.
- 출력 텐서 –
[T, 8]형태로, 각 열은 시간 단계 T에서 해당 화자 채널이 활성화될 확률(기본 10ms 스타일)을 나타냅니다. - 스트리밍 메모리 –
- *도착 순서 화자 캐시(AOSC)*는 청크 간 화자 임베딩을 보존하며, 첫 등장 순서로 정렬됩니다.
- FIFO 큐는 최근 프레임의 맥락을 제공합니다.
- 오른쪽 컨텍스트 버퍼링 – 전환 처리를 개선하기 위해 미래 오디오를 제공하며, 지연 시간과 정확도 간 트레이드오프를 구성 가능하게 합니다.
모델은 Sortformer 원칙을 따릅니다: 화자는 도착 시간 순서로 정렬되어 안정적인 일반 레이블(speaker_0, speaker_1, …)을 제공하고, 각 청크별 순열 해결이 필요 없게 됩니다.
학습 데이터 및 라이선스된 자료의 영향
학습에는 공개 음성 코퍼스 외에도 David AI의 라이선스된 다중 화자 대화 데이터를 사용했습니다. David AI 데이터 추가로 오프라인 및 초저지연 운영 지점에서 복합 DER이 0.77% 절대적으로 감소(11.19% → 10.42%)했습니다.
오프라인 vs. 스트리밍 분리
- 오프라인: 모델이 전체 녹음본을 볼 수 있어 화자 할당에 전역 맥락을 활용할 수 있습니다.
- 스트리밍: 모델은 제한된 왼쪽/오른쪽 맥락을 가진 고정 크기 청크를 처리하며, AOSC와 FIFO에 의존하여 청크 간 화자 정체성을 유지합니다. 동일한 체크포인트가 두 모드 모두에 사용되므로 배포가 간편합니다.
벤치마크 결과 및 상대적 개선
| 데이터셋(서브셋) | 베이스라인 DER | Nemotron-3 DER | 상대적 감소 |
|---|---|---|---|
| VoiceArena(전체) | 19.3% | 14.72% | ~24% |
| DIHARD III(전체) | 19.09% | 12.73% | 33% |
| CALLHOME-Part2(1.04초) | 10.32% | 9.10% | 12% |
| NOTSOFAR1 MHM(1.04초) | 27.5% | 9.6% | 65% |
8개 평가 조건에서 1.04초 지연 시 무게 없는 평균 상대 DER 감소는 **41%**입니다. 화자 수가 많은 서브셋(5명 이상)에서 개선이 더 크며, 모든 지연 설정에서 일관된 성능 향상이 나타납니다.
정확도 vs. 처리량 트레이드오프
- 30.4초 버퍼: 15,113× RTFx, DER 12.73% (DIHARD III).
- 1.04초 버퍼: 865× RTFx, DER 13.18% (DIHARD III).
- 0.32초 버퍼: 최저 지연 시간이지만 DER은 다소 증가하나, 이전 Sortformer 베이스라인보다 여전히 우수합니다.
개발자는 타겟 하드웨어에서 오디오 I/O, 음성 분리, ASR, 후속 처리를 포함한 엔드투엔드 지연 시간을 벤치마크해야 합니다.
화자 할당 ASR과의 통합
음성 분리는 각 화자 채널에 대한 타임스탬프를 제공하고, ASR은 단어 수준 타임스탬프를 제공합니다. 각 단어를 활성화된 화자에 매핑하기 위해 간단한 중간점 정렬 히우리스틱을 사용할 수 있습니다:
midpoint = (word['start'] + word['end']) / 2
label = speaker_at(midpoint)
생산 수준의 전사본을 위해 더 정교한 겹침 처리가 필요할 수 있습니다.
배포 고려 사항
- 화자 제한: 모델은 최대 8명의 동시 화자를 지원하며, 이를 초과하면 음성 누락 또는 잘못된 할당이 발생할 수 있습니다.
- 음향 강건성: 심한 노이즈, 반향, 원거리 캡처, 도메인 전환은 성능 저하를 초래할 수 있습니다.
- 불확실성 처리: 후속 시스템은 할당을 절대적이라고 간주하지 말고 신뢰도 점수를 유지해야 합니다.
- 라이선스: 사용은 OpenMDW 라이선스 v1.1에 따라 규제됩니다.
NVIDIA NeMo Speech 시작하기
apt-get update && apt-get install -y libsndfile1 ffmpeg
uv pip install Cython packaging
uv pip install 'nemo-toolkit[asr]'
from nemo.collections.asr.models import SortformerEncLabelModel
diarmodel = SortformerEncLabelModel.from_pretrained(
"nvidia/Nemotron-3-Diarization"
)
diarmodel.eval()
# 예시 스트리밍 파라미터 (1.04초 지연)
diarmodel.sortformer_modules.spkcache_len = 264
ndiarmodel.sortformer_modules.fifo_len = 40
ndiarmodel.sortformer_modules.chunk_len = 9 # 720ms
ndiarmodel.sortformer_modules.chunk_right_context = 4
ndiarmodel._check_streaming_parameters()
segments = diarmodel.diarize(["/path/to/conversation.wav"], batch_size=1)
print(segments)
diarize() 메서드는 화자 레이블이 붙은 세그먼트(start end speaker_id)를 반환합니다. include_tensor_outputs=True로 설정하면 원시 확률 텐서를 얻을 수 있습니다.
실시간 데모 및 생태계 지원
- 라이브 데모: https://huggingface.co/spaces/nvidia/nemotron-diarization – 합성 8명 화자 대화, 실시간 마이크 입력, 다국어 스트림 지원.
- Argmax Pro SDK 3: 최대 8명의 화자에 대해 디바이스 내 실시간 화자 할당 및 사전 분리된 전사 API 제공.
- 파트너 배포: Baseten, DigitalOcean, Argmax는 생산 수준의 추론, 확장성, 모바일 통합 경로를 제공합니다.
자료
- 모델 카드: https://huggingface.co/nvidia/Nemotron-3-Diarization
- VoiceArena Diarization-Bench 리더보드
- Argmax Pro SDK 3 발표
- NVIDIA NeMo Speech 저장소
- Sortformer 논문(arXiv:2409.06656) 및 Streaming Sortformer 논문(arXiv:2507.18446)
- 음성 분리 + ASR 통합을 위한 빠른 시작 가이드
- 인터랙티브 데모 공간
함의
Nemotron-3 음성 분리는 단일이고 비교적 작은(1억 파라미터) 트랜스포머가 8명의 화자에 대해 최첨단의 화자 할당 정확도를 제공하면서도 다양한 지연 예산을 지원함을 보여줍니다. 이는 회의, 콜센터 분석, 팟캐스트, 디바이스 내 음성 보조기기에서 실시간 다중 화자 전사의 접근 장벽을 낮추며, 향후 음성 분리 연구 및 상용화를 위한 새로운 기준을 설정합니다.