Nemotron-Personas-Japan 릴리스

NVIDIA는 Nemotron-Personas-Japan이라는 오픈 소스 합성 데이터셋을 공개했습니다. 이 데이터셋은 일본 문화, 인구통계 및 사회 규범을 진정으로 이해하는 AI 시스템을 만들 수 있도록 설계되었습니다. 이번 릴리스는 민감한 개인 데이터를 사용하지 않고도 주권 AI(특정 국가의 맥락에서 개발된 AI)를 구축할 수 있는 프라이버시 보호 기반을 개발자에게 제공합니다.

데이터 구성 및 규모

Nemotron-Personas-Japan은 자연스러운 일본어로 작성된 600만 개의 페르소나(레코드당 6개의 페르소나, 총 100만 레코드)를 포함합니다. 이 데이터셋은 CC BY 4.0 라이선스로 공개되어 상업적 및 비상업적 용도로 모두 사용할 수 있습니다.

  • Volume: 총 약 14억 개 토큰 중 페르소나 속성에 해당하는 토큰이 8억 5천만 개 정도입니다.
  • Diversity: 약 95만 개의 고유 이름과 1,500개 이상의 직업 카테고리가 일본 노동력을 반영합니다.
  • Structure: 각 레코드에는 22개의 항목이 포함되며, 6개의 페르소나 관련 항목과 공식 인구·노동 통계에 기반한 16개의 컨텍스트 항목으로 구성됩니다.
  • Coverage: 인구, 지역, 성격 특성 축을 포괄적으로 매핑하여 전문가, 운동선수, 예술가, 여행자, 요리사 등 다양한 유형을 포함합니다.
  • Attributes: 문화적 배경, 기술, 전문성, 경력 목표 및 개인 관심사에 대한 자연어 설명을 제공합니다.

기술 구축 파이프라인

이 데이터셋은 NVIDIA의 합성 데이터 생성 마이크로서비스인 NeMo Data Designer를 사용해 구축되었습니다. 이 복합 AI 시스템은 Jinja 템플릿, Pydantic 검증, 구조화된 출력 및 자동 재시도를 활용해 대규모 데이터 품질을 보장합니다.

생성 모델

파이프라인에서는 두 가지 주요 모델이 사용되었습니다:

  1. Probabilistic Graphical Models (Apache-2.0): 통계적 분포와 일치하도록 생성 과정을 보장합니다.
  2. GPT-OSS-120B (Apache-2.0): 자연스러운 일본어 텍스트 생성을 담당합니다.

문화 및 사회 정렬

페르소나가 현실적이고 문화적으로 진정성을 갖도록 NVIDIA는 원시 통계 외에 다음과 같은 세부 조정을 적용했습니다:

  • Education: 일반 국가 통계보다 세분화된 교육 경로를 도입했습니다.
  • Occupations: 사업주와 특수 직업을 포함하도록 카테고리를 확장했습니다.
  • Life Stages: 학생, 은퇴자, 실업자 등 통계에서 자주 누락되는 상황을 모델링했습니다.
  • Digital Divide: 연령대별 디지털 리터러시 수준을 반영해 실제 일본의 기술 사용 현황을 반영했습니다.
  • Cultural Norms: 일본 고유의 사회·문화적 특성을 통합해 AI 시스템이 지역 규범을 반영하도록 했습니다.

주권 AI 및 모델 개발에 대한 시사점

Nemotron-Personas-Japan은 비영어권 지역에서 고품질의 모국어 학습 데이터가 부족한 문제를 해결합니다. 인구 조사 데이터와 일본식 이름 규칙에 기반한 데이터셋을 제공함으로써, NVIDIA는 서구 중심 데이터셋에 대한 의존도를 낮추고자 합니다.

프라이버시 및 규정 준수

이 데이터셋에는 개인 식별 정보(PII)가 포함되지 않습니다. 모든 페르소나는 공개된 통계 분포를 기반으로 합성 생성된 것이며, 실제 살아 있거나 사망한 개인과 일치하지 않습니다. 이러한 설계는 일본의 Act on the Protection of Personal Information (PIPA) 및 향후 AI 거버넌스 프레임워크와의 규정 준수를 보장합니다.

실용적인 적용 사례

개발자는 다음과 같은 고영향 활용 사례에 이 합성 페르소나를 활용할 수 있습니다:

  • Multi-turn Conversation Synthesis: 페르소나를 "시드"로 사용해 인간과 유사한 대화 데이터셋을 생성합니다.
  • Domain-Specific Assistants: 깊은 문화적 인식과 민감성을 갖춘 AI 에이전트를 만듭니다.
  • Bias Testing and Fairness: 도시와 농촌, 연령대, 교육 수준 등 다양한 인구통계에 걸쳐 AI 시스템의 성능을 평가해 일본 사회 전반에 걸친 공정성을 확보합니다.
  • Model Fine-tuning: Nemotron 모델 및 기타 오픈소스 LLM을 일본어 특화 애플리케이션에 맞게 성능을 향상시킵니다.

Sources