Nemotron-Personas-India:用于主权 AI 的合成数据

NVIDIA 已发布 Nemotron-Personas-India,这是一个大规模的印度语系人物合成数据集,旨在提供隐私保护的基础,以构建针对印度人口、地理和文化分布定制的主权 AI 系统。此发布弥补了大多数开放数据集反映西方规范的数据缺口,使 AI 的开发更能代表印度的多语言和多文字环境。

数据集组成与规模

Nemotron-Personas-India 包含 2100 万人物(源自 300 万条记录,每条记录包含 7 人物)。该数据集采用 CC BY 4.0 许可证,并提供全面的属性集合,以将 AI 模型扎根于印度的实际情况。

关键统计

  • 总标记数: 77 亿标记,包括 29 亿人物标记。
    • 英语: 10 亿总标记(3.94 亿人物标记)。
    • 印地语(天城文): 47 亿总标记(18 亿人物标记)。
    • 印地语(拉丁文): 20 亿总标记(7.46 亿人物标记)。
  • 人口覆盖: 包含印度全部 36 个邦和 640 个地区。
  • 多样性指标: 包含约 56 万个唯一全名和 2,900 个职业类别,覆盖正规、非正规和传统部门(例如农业、街头摊贩)。
  • 数据字段: 每条记录包含 27 个字段,包括年龄、性别、教育、职业、州、地区,以及用于文化背景、技能、爱好和语言背景的自然语言字段。

技术实现与流水线

该数据集使用 NeMo Data Designer(NVIDIA 的合成数据生成微服务)生成。该复合 AI 系统利用 Jinja 模板、Pydantic 验证和结构化输出以实现大规模生成。

生成模型

流水线中使用了两种主要模型:

  1. 概率图模型(Apache-2.0): 用于统计基础,以确保数据反映真实世界的分布。
  2. GPT-OSS-120B(Apache-2.0): 用于在英语、印地语(天城文)和印地语(拉丁文)之间生成叙述。

文化与统计基础

为确保真实性,数据集与官方人口分布(2011 年人口普查)和 Parsed Indian Electoral Rolls 对齐。它特别包括:

  • 扩展教育与职业: 包含多样的学术路径和传统部门。
  • 人生阶段: 为学生、家庭主妇以及退休/失业者设定类别。
  • 数字鸿沟: 基于收入、年龄和城乡差异建模使用模式。
  • 语言多样性: 为每个人物详细映射第一、第二和第三语言。

隐私与安全

Nemotron-Personas-India 采用 设计即私密 的原则。由于所有人物均为完全合成,不存在重新识别或与任何在世或已故个人关联的风险。这使开发者能够在不受敏感个人数据监管障碍的情况下训练模型。

AI 开发的实际应用

该数据集使开发者能够构建具备地区感知的 AI 代理和领域特定的副驾驶,能够在印度多元社区中实现泛化。关键应用包括:

  • 多语言微调: 生成印度语言和文字的训练数据,以处理复杂的多轮对话。
  • 文化细微差别: 微调模型以捕捉当地的社会和职业细微差别。
  • **主权 AI: 支持开发结合地区特定人口统计的 AI 系统,以减轻偏见并防止因未筛选的合成数据导致的模型崩溃。

集成与可用性

该数据集可通过 Hugging Face datasets 库获取。用户可以根据语言和文字加载特定子集:

from datasets import load_dataset

# English personas
nemotron_personas_en = load_dataset("nvidia/Nemotron-Personas-India", "en_IN")
# Hindi personas in Devanagari
nemotron_personas_hi_deva = load_dataset("nvidia/Nemotron-Personas-India", "hi_Deva_IN")
# Hindi personas in Hindi (Latin)
nemotron_personas_hi_latn = load_dataset("nvidia/Nemotron-Personas-India", "hi_Latn_IN")

通过 NeMo Data Designer 可获取包含合成地址、宗教以及名/姓的扩展版本。

Sources