Nemotron-Personas-Japan 發布

NVIDIA 已發布 Nemotron-Personas-Japan,這是一個開源合成資料集,旨在讓 AI 系統真正了解日本的文化、人口統計與社會規範。此發布提供了隱私保護的基礎,讓開發者能在不依賴敏感個人資料的情況下構建主權 AI——在特定國家情境下開發的 AI。

資料集組成與規模

Nemotron-Personas-Japan 包含 600 萬人物角色(1 百萬筆記錄,每筆包含 6 個角色),以自然日文撰寫。該資料集以 CC BY 4.0 授權釋出,可供商業與非商業用途使用。

主要技術規格包括:

  • Volume(規模): 約 14 億個總 token,其中約 8.5 億個 token 與人物屬性相關。
  • Diversity(多樣性): 約 95 萬個唯一姓名,超過 1,500 個職業類別,反映日本勞動力。
  • Structure(結構): 每筆記錄包含 22 個項目,分為 6 個與人物相關的項目與 16 個基於官方人口與勞動統計的情境項目。
  • Coverage(覆蓋範圍): 在人口、區域與人格特質等軸向上提供完整映射,涵蓋專業人士、運動員、藝術家、旅行者與廚師等多樣類型。
  • Attributes(屬性): 以自然語言描述文化背景、技能、專長、職業目標與個人興趣。

技術建構流程

該資料集使用 NeMo Data Designer 建置,這是 NVIDIA 的合成資料生成微服務。此複合 AI 系統利用 Jinja 模板、Pydantic 驗證、結構化輸出與自動重試,以確保大規模資料品質。

生成模型

管線中使用了兩個主要模型:

  1. Probabilistic Graphical Models (Apache-2.0):用於確保生成符合統計分布。
  2. GPT-OSS-120B (Apache-2.0):用於生成自然日文文本。

文化與社會對齊

為確保人物角色具備真實性與文化真實感,NVIDIA 在原始統計之外實施了特定的精細化調整:

  • Education(教育): 引入比一般全國統計更細緻的教育路徑區分。
  • Occupations(職業): 擴充類別,納入企業主與專業職業。
  • Life Stages(人生階段): 模擬統計中常被低估的情境,如學生、退休者與失業者。
  • Digital Divide(數位鴻溝): 融入不同年齡層的數位素養差異,以反映日本實際的科技使用情況。
  • Cultural Norms(文化規範): 整合特定的日本社會與文化特徵,協助 AI 系統體現區域規範。

主權 AI 與模型開發的影響

Nemotron-Personas-Japan 解決了非英語區域高品質本土語言訓練資料的嚴重短缺。透過提供以人口普查資料與日本命名慣例為基礎的資料集,NVIDIA 旨在減少對西方中心資料集的依賴。

隱私與合規

該資料集不包含任何個人可識別資訊(PII)。所有人物角色皆根據公開統計分布合成生成,並不對應任何真實在世或已故個人。此設計確保符合日本的 Act on the Protection of Personal Information (PIPA) 以及未來的 AI 治理框架。

實務應用

開發者可將這些合成人物角色應用於多個高影響力的使用情境:

  • Multi-turn Conversation Synthesis(多輪對話合成): 將人物角色作為「種子」生成類人對話資料集。
  • Domain-Specific Assistants(領域特定助理): 建立具深度文化意識與敏感度的 AI 代理人。
  • Bias Testing and Fairness(偏見測試與公平性): 評估 AI 系統在不同人口統計(如城鄉、年齡層、教育程度)下的表現,以確保在日本社會中實現公平的 AI 效能。
  • Model Fine-tuning(模型微調): 提升 Nemotron 模型與其他開源大型語言模型在日本特定應用上的效能。

Sources