Nemotron-Personas-India: 主権AIのための合成データ
NVIDIAは Nemotron-Personas-India をリリースしました。これは、インドの人口統計、地理、文化的分布に合わせた主権AIシステムを構築するためのプライバシー保護された基盤を提供することを目的とした、大規模な合成インディックペルソナデータセットです。このリリースは、ほとんどのオープンデータセットが西洋の規範を反映しているというデータギャップに対処し、インドの多言語・多スクリプト環境をより代表するAIの開発を可能にします。
データセットの構成と規模
Nemotron-Personas-India は 2100万ペルソナ(300万レコードから派生し、各レコードに7つのペルソナが含まれる)で構成されています。データセットは CC BY 4.0 の下でライセンスされており、インドの現実にAIモデルを根付かせるための包括的な属性セットを提供します。
主な統計
- 総トークン数: 77億トークン(うち29億トークンはペルソナトークン)
- 英語: 10億総トークン(3.94億ペルソナトークン)
- ヒンディー語(デーヴァナーガリー): 47億総トークン(18億ペルソナトークン)
- ヒンディー語(ラテン): 20億総トークン(7.46億ペルソナトークン)
- 人口統計カバレッジ: インドの36州と640地区すべてをカバー
- 多様性指標: 約56万件のユニークなフルネームと2,900の職業カテゴリを含み、正式部門、非公式部門、伝統的部門(例:農業、路上販売)を網羅
- データフィールド: 各レコードは27項目を含み、年齢、性別、教育、職業、州、地区に加え、文化的背景、スキル、趣味、言語的背景に関する自然言語フィールドが含まれます。
技術的実装とパイプライン
このデータセットは NeMo Data Designer を使用して生成されました。NVIDIAの合成データ生成マイクロサービスです。この複合AIシステムはJinjaテンプレート、Pydanticバリデーション、構造化出力を活用し、生成をスケールさせます。
生成モデル
パイプラインでは主に2つのモデルが使用されました:
- Probabilistic Graphical Model (Apache-2.0): 統計的基盤として使用され、データが実世界の分布を反映することを保証します。
- GPT-OSS-120B (Apache-2.0): 英語、ヒンディー語(デーヴァナーガリー)およびヒンディー語(ラテン)でのナラティブ生成に使用されます。
文化的・統計的基盤
データの真正性を確保するため、2011 Census と Parsed Indian Electoral Rolls の公式人口統計分布に合わせています。具体的には以下を組み込んでいます:
- 拡張された教育と職業: 多様な学術経路と伝統的部門の包含。
- ライフステージ: 学生、主婦、退職者/失業者向けのカテゴリ。
- デジタル格差: 所得、年齢、都市/農村の分断に基づく利用パターンのモデリング。
- 言語的多様性: 各ペルソナの第一、第二、第三言語の詳細なマッピング。
プライバシーと安全性
Nemotron-Personas-India は private by design です。すべてのペルソナが完全に合成されているため、個人の再識別や生存者・故人との結びつきのリスクはありません。これにより、開発者は規制上の障壁なしにモデルをトレーニングできます。
AI開発の実用的応用
このデータセットは、地域に配慮したAIエージェントやドメイン固有のコパイロットを構築し、インドの多様なコミュニティ全体に汎用化できるようにします。主な応用例は以下の通りです:
- マルチリンガルファインチューニング: インドの言語とスクリプトでトレーニングデータを生成し、複雑なマルチターン会話に対応。
- 文化的ニュアンス: ローカルな社会的・職業的ニュアンスを捉えるためのモデルファインチューニング。
- ****Sovereign AI: 地域固有の人口統計を組み込んだAIシステムの開発を支援し、バイアスを軽減し、未整理の合成データによるモデル崩壊を防止。
統合と利用可能性
データセットは Hugging Face datasets ライブラリ経由で利用可能です。ユーザーは言語とスクリプトに基づいて特定のサブセットをロードできます:
from datasets import load_dataset
# English personas
nemotron_personas_en = load_dataset("nvidia/Nemotron-Personas-India", "en_IN")
# Hindi personas in Devanagari
nemotron_personas_hi_deva = load_dataset("nvidia/Nemotron-Personas-India", "hi_Deva_IN")
# Hindi personas in Hindi (Latin)
nemotron_personas_hi_latn = load_dataset("nvidia/Nemotron-Personas-India", "hi_Latn_IN")
合成住所、宗教、姓/名を含む拡張バージョンは NeMo Data Designer を通じて利用可能です。
NVIDIAは Nemotron-Personas-India をリリースしました。これは CC BY 4.0 ライセンスの下で提供される、2100万件のインディックペルソナからなる合成データセットで、インドの多言語かつ文化的に多様な環境における主権AIのデータギャップを埋めることを目的としています。