Nemotron-Personas-India: 主権AIのための合成データ

NVIDIAは Nemotron-Personas-India をリリースしました。これは、インドの人口統計、地理、文化的分布に合わせた主権AIシステムを構築するためのプライバシー保護された基盤を提供することを目的とした、大規模な合成インディックペルソナデータセットです。このリリースは、ほとんどのオープンデータセットが西洋の規範を反映しているというデータギャップに対処し、インドの多言語・多スクリプト環境をより代表するAIの開発を可能にします。

データセットの構成と規模

Nemotron-Personas-India は 2100万ペルソナ(300万レコードから派生し、各レコードに7つのペルソナが含まれる)で構成されています。データセットは CC BY 4.0 の下でライセンスされており、インドの現実にAIモデルを根付かせるための包括的な属性セットを提供します。

主な統計

  • 総トークン数: 77億トークン(うち29億トークンはペルソナトークン)
    • 英語: 10億総トークン(3.94億ペルソナトークン)
    • ヒンディー語(デーヴァナーガリー): 47億総トークン(18億ペルソナトークン)
    • ヒンディー語(ラテン): 20億総トークン(7.46億ペルソナトークン)
  • 人口統計カバレッジ: インドの36州と640地区すべてをカバー
  • 多様性指標: 約56万件のユニークなフルネームと2,900の職業カテゴリを含み、正式部門、非公式部門、伝統的部門(例:農業、路上販売)を網羅
  • データフィールド: 各レコードは27項目を含み、年齢、性別、教育、職業、州、地区に加え、文化的背景、スキル、趣味、言語的背景に関する自然言語フィールドが含まれます。

技術的実装とパイプライン

このデータセットは NeMo Data Designer を使用して生成されました。NVIDIAの合成データ生成マイクロサービスです。この複合AIシステムはJinjaテンプレート、Pydanticバリデーション、構造化出力を活用し、生成をスケールさせます。

生成モデル

パイプラインでは主に2つのモデルが使用されました:

  1. Probabilistic Graphical Model (Apache-2.0): 統計的基盤として使用され、データが実世界の分布を反映することを保証します。
  2. GPT-OSS-120B (Apache-2.0): 英語、ヒンディー語(デーヴァナーガリー)およびヒンディー語(ラテン)でのナラティブ生成に使用されます。

文化的・統計的基盤

データの真正性を確保するため、2011 CensusParsed Indian Electoral Rolls の公式人口統計分布に合わせています。具体的には以下を組み込んでいます:

  • 拡張された教育と職業: 多様な学術経路と伝統的部門の包含。
  • ライフステージ: 学生、主婦、退職者/失業者向けのカテゴリ。
  • デジタル格差: 所得、年齢、都市/農村の分断に基づく利用パターンのモデリング。
  • 言語的多様性: 各ペルソナの第一、第二、第三言語の詳細なマッピング。

プライバシーと安全性

Nemotron-Personas-India は private by design です。すべてのペルソナが完全に合成されているため、個人の再識別や生存者・故人との結びつきのリスクはありません。これにより、開発者は規制上の障壁なしにモデルをトレーニングできます。

AI開発の実用的応用

このデータセットは、地域に配慮したAIエージェントやドメイン固有のコパイロットを構築し、インドの多様なコミュニティ全体に汎用化できるようにします。主な応用例は以下の通りです:

  • マルチリンガルファインチューニング: インドの言語とスクリプトでトレーニングデータを生成し、複雑なマルチターン会話に対応。
  • 文化的ニュアンス: ローカルな社会的・職業的ニュアンスを捉えるためのモデルファインチューニング。
  • ****Sovereign AI: 地域固有の人口統計を組み込んだAIシステムの開発を支援し、バイアスを軽減し、未整理の合成データによるモデル崩壊を防止。

統合と利用可能性

データセットは Hugging Face datasets ライブラリ経由で利用可能です。ユーザーは言語とスクリプトに基づいて特定のサブセットをロードできます:

from datasets import load_dataset

# English personas
nemotron_personas_en = load_dataset("nvidia/Nemotron-Personas-India", "en_IN")
# Hindi personas in Devanagari
nemotron_personas_hi_deva = load_dataset("nvidia/Nemotron-Personas-India", "hi_Deva_IN")
# Hindi personas in Hindi (Latin)
nemotron_personas_hi_latn = load_dataset("nvidia/Nemotron-Personas-India", "hi_Latn_IN")

合成住所、宗教、姓/名を含む拡張バージョンは NeMo Data Designer を通じて利用可能です。

NVIDIAは Nemotron-Personas-India をリリースしました。これは CC BY 4.0 ライセンスの下で提供される、2100万件のインディックペルソナからなる合成データセットで、インドの多言語かつ文化的に多様な環境における主権AIのデータギャップを埋めることを目的としています。

Sources