NVIDIA Nemotron 사후 학습 데이터셋 v2 및 Nemotron Nano 2 9B 출시

NVIDIA는 Nemotron 사후 학습 데이터셋 v2와 Nemotron Nano 2 9B 모델을 함께 공개했습니다. 이 데이터셋은 600만 개의 다국어 추론 예시를 포함합니다. 이번 발표는 고품질 학습 데이터를 제공하고, 정확도와 비용의 균형을 맞출 수 있는 구성 가능한 사고 예산을 갖춘 효율적인 엣지용 모델을 제공함으로써 오픈 웨이트 모델 생태계를 지원하는 것을 목표로 합니다.

Nemotron Nano 2 9B 모델 사양

Nemotron Nano 2 9B는 엣지 및 RTX 배포를 위해 설계되었으며, 특히 분석 코파일럿, 지원 챗봇 및 고객 서비스 에이전트를 대상으로 합니다.

기술 아키텍처 및 성능

  • Hybrid Architecture: 모델은 하이브리드 Transformer–Mamba 아키텍처(제한된 수의 어텐션 레이어와 결합된 Mamba-2)를 사용하여, 유사한 규모의 Transformer 전용 모델에 비해 높은 처리량을 제공합니다.
  • Throughput: 모델은 동일한 9B 파라미터 규모의 다른 주요 모델에 비해 토큰 생성 처리량이 최대 6배 높습니다.
  • Cost Optimization: 구성 가능한 "thinking budget"를 통해 사용자는 사용되는 추론 토큰 수를 제어할 수 있으며, 이를 통해 추론 비용을 최대 60% 절감할 수 있습니다.
  • Licensing: 모델은 nvidia-open-model-license 하에 공개됩니다.

Nemotron 사후 학습 데이터셋 v2 구성

Nemotron 사후 학습 데이터셋 v2는 원본 영어 추론 데이터를 다섯 개 목표 언어인 프랑스어, 스페인어, 독일어, 이탈리아어, 일본어로 번역한 600만 개의 추론 예시로 구성됩니다.

번역 방법론

영어 사전 학습 지식을 활용하기 위해 NVIDIA는 사용자 프롬프트와 모델 응답을 번역하면서 원본 영어 추론 체인은 그대로 유지했습니다. 번역 과정에서는 독일어에 Qwen2.5-32B-Instruct-AWQ를, 다른 언어에는 Qwen2.5-14B-Instruct를 사용했으며, 이들은 높은 품질, 오픈 Apache 2.0 라이선스, 단일 A100 GPU에 적합한 점을 고려했습니다.

품질 관리 및 환각 완화

NVIDIA는 LLM이 표준 기계 번역 세트에 비해 SFT(감독 미세조정) 데이터셋을 번역할 때 환각이 더 많이 발생하고, 입력 길이가 길어질수록 품질이 저하된다는 점을 확인했습니다. 이를 완화하기 위해 다음 메커니즘을 구현했습니다:

  • Line-by-Line Translation: 문장은 줄바꿈을 기준으로 분리되며, 번역이 불가능한 줄(예: 탭) 및 코드 블록은 번역 없이 그대로 유지됩니다.
  • Format Enforcement: 번역은 특정 괄호(– –) 안에 포함되어야 하며, 이 형식을 따르지 않는 예시는 폐기됩니다.
  • Language Identification: fastText 언어 식별 도구를 프롬프트 입력에 적용해 목표 언어가 아닌 데이터를 필터링했습니다. 이 과정에서 55,567개의 예시(전체 다국어 예시의 약 1.1%)가 제거되었습니다.

형식 강제에 따른 데이터 폐기 비율

다음 표는 출력 형식 강제로 인해 폐기된 데이터 비율(바이트 기준)을 보여줍니다.

언어 코드 질문·답변 수학
독일어 (de) 2.28% 1.11% 2.47%
스페인어 (es) 26.14% 5.15% 6.38%
프랑스어 (fr) 11.01% 1.37% 1.96%
이탈리아어 (it) 4.94% 1.36% 0.75%
일본어 (ja) 7.68% 2.51% 3.86%

이용 가능성

Nemotron 사후 학습 데이터셋 v2는 Hugging Face에서 제공됩니다. Nemotron Nano 2 9B 모델 가중치 역시 Hugging Face에 호스팅되어 있으며, 엔드포인트는 build.nvidia.com을 통해 이용 가능하고, 저지연·고처리량 요구사항을 위한 NVIDIA NIM 형태로도 제공됩니다.

Sources