NVIDIA Nemotron 3.5 콘텐츠 안전 릴리스
NVIDIA Nemotron 3.5 콘텐츠 안전 릴리스
NVIDIA는 맞춤 정책 적용 및 선택적 추론 흔적을 갖춘 4B 파라미터 멀티모달, 다국어 안전 모델인 Nemotron 3.5 콘텐츠 안전을 기업용 AI를 위해 출시했습니다.
TL;DR
NVIDIA는 멀티모달 입력, 다국어 지원, 맞춤 기업 정책 적용, 그리고 감사가 가능한 추론을 하나의 추론 호출에서 통합하는 단일 4B 파라미터 모델인 Nemotron 3.5 콘텐츠 안전을 발표했습니다.
통합 멀티모달 평가
Nemotron 3.5는 사용자 프롬프트, 선택적 이미지, 그리고 선택적 어시스턴트 응답을 하나의 컨텍스트 윈도우로 함께 평가하여 결합된 입력에 대한 일관된 안전 판단을 생성합니다. 이 공동 평가는 텍스트와 이미지 간의 상호작용, 또는 요청과 응답 간의 상호작용에서만 정책 위반이 나타나는 격차를 해소합니다. 이는 각 모달리티를 독립적으로 점수 매길 때 놓치던 부분입니다.
글로벌 언어 커버리지
Nemotron 3.5는 영어, 프랑스어, 스페인어, 독일어, 중국어, 일본어, 한국어, 아랍어, 힌디어, 러시아어, 포르투갈어, 이탈리아어 등 12개 언어에 대한 명시적 훈련을 유지하면서, Gemma 3 기본 모델로부터 약 140개의 추가 언어에 대해 제로샷 일반화를 상속합니다. 저자원 시장에서의 배포는 별도의 파인튜닝 없이 이 전이 학습의 혜택을 받습니다.
맞춤 정책 적용
이 모델은 입력과 함께 맞춤 정책 사양을 수용하고, 내장된 분류체계에 solely 의존하는 대신 해당 정책에 대해 추론하여 판단을 내립니다. これにより 기업은 관련 없는 카테고리를 억제하고, 독점적 위험 카테고리를 주입하며, 의료, 금융 또는 어린이용 앱과 같은 도메인별 규칙에 맞게 안전 동작을 조정할 수 있습니다.
추론 흔적 (THINK 모드)
THINK 모드가 활성화되면, Nemotron 3.5는 최종 safe/unsafe 라벨과 선택적 위반 카테고리를 제공하기 전에 단계별 추론 흔적을 출력합니다. 예시 추론 형식은 다음과 같습니다:
[step-by-step reasoning trace]
User Safety: unsafe
Response Safety: unsafe
Safety Categories: Criminal Planning/Confessions, Controlled Substances
지연 시간이 중요한 경우, THINK 모드를 비활성화하여 Nemotron 3에서 제공되는 동일한 저지연 바이너리 판결로 돌아갈 수 있습니다.
안전 데이터셋
NVIDIA는 멀티모달, 다국어이며 모델 훈련에 사용된 안전 추론 흔적을 포함하는 Nemotron 3.5 콘텐츠 안전 데이터셋을 출시합니다. 이 데이터셋은 실제 사진 멀티모달 데이터, 다국어 텍스트 안전 데이터, 안전한 VLM 데이터, 더 큰 교사 모델에서 파생된 추론 흔적, 토픽 추적 데이터, 그리고 jailbreak 다양화를 위한 소량의 합성 데이터로 구성됩니다.
모델 아키텍처
Nemotron 3.5 콘텐츠 안전은 128K 컨텍스트 윈도우, 강력한 비전-언어 추론, 그리고 광범위한 다국어 커버리지를 갖춘 Google Gemma 3 4B IT (4B 파라미터)를 기반으로 구축되었습니다. LoRA 어댑터는 기본 모델을 파인튜닝하여 대상 안전 분류 동작을 설치하면서, 8GB+ VRAM GPU에서 실시간 배포를 위한 컴팩트한 모델 크기를 유지합니다. 이 모델은 세 가지 출력 모드를 지원합니다: 저지연 바이너리 판결, 카테고리가 포함된 바이너리 판결, 그리고 THINK 모드(추론 + 판결).
추론
추론은 특히 규제된 환경에서 생산 AI 시스템에 필요한 맥락, 맞춤화, 그리고 책임을 제공합니다. 이는 맞춤 정책의 동적 해석을 가능하게 하며, 규정 준수 로깅 및 인간 검토를 위한 감사 가능한 정당성을 제공하고, 정책 반복을 위한 에지 케이스 해석을 드러냅니다. 추론 흔적을 간결한 요약으로 압축하면 출력 토큰이 제한되고 효율성이 유지되며, 이는 Nemotron Content Safety Reasoning 4B 모델에서 이어진 기술입니다.
지연 시간
기본 모드(THINK 없음)에서 지연 시간은 Nemotron 3과 변함이 없습니다. THINK 모드를 활성화하면 추론 길이에 비례하는 추론 시간이 추가되지만, 이 오버헤드는 예측 가능하며 별도로 예산에 책정할 수 있습니다—for example, 기본 모드가 실시간 결정을 처리하는 동안 감사 파이프라인에서 THINK‑mode 평가를 비동기식으로 실행함으로써 가능합니다. 대체 멀티모달 안전 모델과 비교했을 때, Nemotron 3.5는 멀티모달 벤치마크에서 종단 간 지연 시간을 3배 낮추며, 추론이 활성화될 때 토큰을 최대 50% 적게 생성합니다.
벤치마크 격차 해결
기존 멀티모달 안전 벤치마크는 텍스트 전용 커버리지, 실제 세계 텍스처가 부족한 합성 이미지(일반적으로 SDXL)에 대한 의존, 그리고 실제 사진 재배포를 방지하는 라이선스 제한으로 인해 어려움을 겪습니다. 이러한 격차로 인해 벤치마크 결과가 실제 생산 난이도를 반영하지 못할 수 있습니다. NVIDIA의 훈련 데이터는 실제 이미지와 문화적으로 세련된 다국어 프롬프트를 사용하여 모델 훈련에 대한 일부 격차를 완화하지만, 평가 격차는 더 넓은 안전 연구 커뮤니티에 대한 미해결 문제로 남아 있습니다.
시작하기
Nemotron 3.5 콘텐츠 안전은 연구 및 상업용으로 NVIDIA 오픈 모델 라이선스 하에 Hugging Face에서 훈련 데이터셋과 함께 제공됩니다. Transformers, vLLM, SGLang을 지원하며, build.nvidia.com에서 프로덕션 등급 NVIDIA NIM(nvcr.io/nim/nvidia/nemotron-3.5-content-safety:2.0.5-variant)으로 제공됩니다. 또한 Baseten, Eigen AI, DeepInfra, OpenRouter, Vultr과 같은 추론 플랫폼을 통해 모델에 접근할 수 있습니다. 맞춤 정책 워크플로우를 위해, NVIDIA는 Claude‑ 및 Codex‑호환 스킬을 제공하여 맞춤 정책을 생성하고 모델 사용법을 보여주는 쿡북을 제공합니다.