Nemotron-Personas-India:主權 AI 的合成資料

NVIDIA 已發布 Nemotron-Personas-India,這是一個大規模的合成印度語系人物資料集,旨在提供隱私保護的基礎,以構建針對印度人口、地理與文化分布量身打造的主權 AI 系統。此發佈填補了大多數開放資料集僅反映西方規範的資料缺口,使 AI 的開發更能代表印度的多語言與多文字環境。

資料集組成與規模

Nemotron-Personas-India 包含 2100 萬人物(來源於 300 萬筆記錄,每筆記錄包含 7 個人物)。資料集採用 CC BY 4.0 授權,並提供完整的屬性集合,使 AI 模型能根植於印度的現實。

主要統計

  • 總標記數(Tokens): 77 億個標記,其中包括 29 億個人物標記。
    • 英語: 總計 10 億個標記(其中 3.94 億個人物標記)。
    • 印地語(天城文): 總計 47 億個標記(其中 18 億個人物標記)。
    • 印地語(拉丁字母): 總計 20 億個標記(其中 7.46 億個人物標記)。
  • 人口覆蓋範圍: 包含印度全部 36 個邦與 640 個區域。
  • 多樣性指標: 約有 56 萬個唯一全名與 2,900 個職業類別,涵蓋正式、非正式與傳統產業(例如農業、街頭販售)。
  • 資料欄位: 每筆記錄包含 27 個欄位,包括年齡、性別、教育、職業、州、省、市,以及用自然語言描述的文化背景、技能、興趣與語言背景。

技術實作與流程

此資料集使用 NeMo Data Designer(NVIDIA 的合成資料生成微服務)製作。此複合 AI 系統利用 Jinja 模板、Pydantic 驗證與結構化輸出來擴展生成規模。

生成模型

管線中使用了兩個主要模型:

  1. Probabilistic Graphical Model (Apache-2.0): 用於統計基礎,以確保資料反映真實世界的分布。
  2. GPT-OSS-120B (Apache-2.0): 用於在英語、印地語(天城文)與印地語(拉丁字母)之間生成敘事。

文化與統計基礎

為確保真實性,資料集與官方的人口分布(來自 2011 Census)以及 Parsed Indian Electoral Rolls)對齊。它特別納入了:

  • 擴展的教育與職業: 包含多元的學術路徑與傳統產業。
  • 人生階段: 包括學生、家庭主婦以及退休/失業者等類別。
  • 數位鴻溝: 依據收入、年齡與城鄉差異建模使用模式。
  • 語言多樣性: 為每個人物詳細映射第一、第二與第三語言。

隱私與安全

Nemotron-Personas-India 採用 private by design 設計。由於所有人物皆為完全合成,沒有任何重新識別或與在世或已故個人相關聯的風險。這讓開發者能在不受敏感個人資料法規限制的情況下訓練模型。

AI 開發的實務應用

此資料集讓開發者能構建具備區域感知的 AI 代理人與領域特定的協助工具,能在印度多元社群中泛化。主要應用包括:

  • 多語言微調: 產生印度語言與文字的訓練資料,以處理複雜的多輪對話。
  • 文化細微差異: 微調模型以捕捉在地社會與職業的細節。
  • 主權 AI: 支援開發結合區域特定人口統計的 AI 系統,以減少偏見並防止因未經篩選的合成資料導致的模型崩潰。

整合與可用性

此資料集可透過 Hugging Face datasets 函式庫取得。使用者可依語言與文字載入特定子集:

from datasets import load_dataset

# English personas
nemotron_personas_en = load_dataset("nvidia/Nemotron-Personas-India", "en_IN")
# Hindi personas in Devanagari
nemotron_personas_hi_deva = load_dataset("nvidia/Nemotron-Personas-India", "hi_Deva_IN")
# Hindi personas in Hindi (Latin)
nemotron_personas_hi_latn = load_dataset("nvidia/Nemotron-Personas-India", "hi_Latn_IN")

透過 NeMo Data Designer,亦提供包含合成地址、宗教與姓氏/名字的擴充版本。

Sources