Nemotron-Personas-India: 주권 AI를 위한 합성 데이터
NVIDIA는 Nemotron-Personas-India를 출시했습니다. 이 대규모 합성 인도어 페르소나 데이터셋은 인도의 인구통계, 지리적, 문화적 분포에 맞춘 주권 AI 시스템을 구축하기 위한 프라이버시 보호 기반을 제공하도록 설계되었습니다. 대부분의 공개 데이터셋이 서구 기준을 반영하는 데이터 격차를 해소하여, 인도의 다언어 및 다스크립트 환경을 보다 잘 대표하는 AI 개발을 가능하게 합니다.
데이터셋 구성 및 규모
Nemotron-Personas-India는 2100만 개의 페르소나(각 레코드에 7개의 페르소나가 포함된 300만 레코드에서 파생)로 구성됩니다. 데이터셋은 CC BY 4.0 라이선스를 갖고 있으며, AI 모델을 인도 현실에 맞추기 위한 포괄적인 속성 세트를 제공합니다.
주요 통계
- 전체 토큰: 77억 토큰, 그 중 페르소나 토큰 29억 포함.
- 영어: 총 10억 토큰(페르소나 토큰 3.94억).
- 힌디어 (데바나가리): 총 47억 토큰(페르소나 토큰 18억).
- 힌디어 (라틴): 총 20억 토큰(페르소나 토큰 7.46억).
- 인구통계 커버리지: 인도 36개 주와 640개 구역을 모두 포함합니다.
- 다양성 지표: 약 56만 개의 고유 전체 이름과 2,900개의 직업 카테고리를 포함하며, 공식, 비공식 및 전통 부문(예: 농업, 거리 판매)을 포괄합니다.
- 데이터 필드: 각 레코드에는 연령, 성별, 교육, 직업, 주, 구역 등 27개의 필드가 포함되며, 문화 배경, 기술, 취미, 언어 배경을 위한 자연어 필드도 포함됩니다.
기술 구현 및 파이프라인
데이터셋은 NeMo Data Designer를 사용하여 제작되었습니다. 이는 NVIDIA의 합성 데이터 생성 마이크로서비스이며, Jinja 템플릿, Pydantic 검증, 구조화된 출력을 활용해 대규모 생성을 가능하게 하는 복합 AI 시스템입니다.
생성 모델
파이프라인에서는 두 가지 주요 모델이 사용되었습니다:
- Probabilistic Graphical Model (Apache-2.0): 통계적 기반을 제공하여 데이터가 실제 분포를 반영하도록 사용됩니다.
- GPT-OSS-120B (Apache-2.0): 영어, 힌디어(데바나가리), 힌디어(라틴) 전반에 걸친 서술 생성에 사용됩니다.
문화 및 통계적 기반
진정성을 보장하기 위해 데이터셋은 2011년 인구조사와 Parsed Indian Electoral Rolls의 공식 인구통계 분포와 일치하도록 맞추어졌습니다. 구체적으로 다음을 포함합니다:
- 확장된 교육 및 직업: 다양한 학문 경로와 전통 부문을 포함합니다.
- 생애 단계: 학생, 가정주부, 은퇴/실업자 카테고리를 포함합니다.
- 디지털 격차: 소득, 연령, 도시/농촌 구분에 따른 사용 패턴을 모델링합니다.
- 언어 다양성: 각 페르소나에 대한 1차, 2차, 3차 사용 언어를 상세히 매핑합니다.
프라이버시 및 안전
Nemotron-Personas-India는 설계상 프라이버시를 보장합니다. 모든 페르소나가 완전 합성되었기 때문에 살아 있거나 사망한 개인과 연결되거나 재식별될 위험이 없습니다. 이를 통해 개발자는 민감한 개인 데이터와 관련된 규제 장벽 없이 모델을 학습할 수 있습니다.
AI 개발을 위한 실용적 적용
이 데이터셋은 개발자가 인도의 다양한 커뮤니티 전반에 일반화되는 지역 인식 AI 에이전트와 도메인 특화 코파일럿을 구축할 수 있게 합니다. 주요 적용 분야는 다음과 같습니다:
- 다언어 파인튜닝: 복잡한 다중 턴 대화를 처리하기 위해 인도 언어 및 스크립트로 학습 데이터를 생성합니다.
- 문화적 뉘앙스: 현지 사회 및 직업적 뉘앙스를 포착하도록 모델을 파인튜닝합니다.
- **Sovereign AI: 지역별 인구통계를 통합하여 편향을 완화하고, 정제되지 않은 합성 데이터로 인한 모델 붕괴를 방지하는 AI 시스템 개발을 지원합니다.
통합 및 이용 가능성
데이터셋은 Hugging Face datasets 라이브러리를 통해 제공됩니다. 사용자는 언어와 스크립트에 따라 특정 하위 집합을 로드할 수 있습니다:
from datasets import load_dataset
# English personas
nemotron_personas_en = load_dataset("nvidia/Nemotron-Personas-India", "en_IN")
# Hindi personas in Devanagari
nemotron_personas_hi_deva = load_dataset("nvidia/Nemotron-Personas-India", "hi_Deva_IN")
# Hindi personas in Hindi (Latin)
nemotron_personas_hi_latn = load_dataset("nvidia/Nemotron-Personas-India", "hi_Latn_IN")
합성 주소, 종교, 이름/성을 포함한 확장 버전은 NeMo Data Designer를 통해 제공됩니다.