Hugging Face 與 IISc 合作開源 Vaani 資料集
Hugging Face 已與印度科學學院(IISc)和 ARTPARK 合作,提供全球存取 Vaani 的途徑,Vaani 是一個龐大的多模態、多語言資料集,旨在代表印度的語言多樣性。此合作旨在提升該資料集的可存取性與可用性,以促進開發能更好滿足印度多樣語言人口數位需求的 AI 系統。
Vaani 資料集:範圍與方法
Vaani 資料集是一項由 IISc/ARTPARK 與 Google 在 2022 年啟動的開源計畫。它採用地理中心的方法,從偏遠地區收集方言與語言,確保資料不僅代表主流語言。
資料收集目標
Vaani 旨在從印度全境 773 個區的 100 萬人中收集以下資料點:
- 總語音資料:超過 150,000 小時。
- 轉錄文字資料:15,000 小時。
實施階段
- 第一階段:已覆蓋 80 個區,並且已經開源。
- 第二階段:目前正在進行中,擴充資料集至另外 100 個區,使覆蓋範圍延伸至全印度所有州。
專門的資料子集
為了方便特定的 AI 任務,較大的 Vaani 資料集的轉錄子集已經開源。該子集包含來自約 700,000 位說話者的 790 小時轉錄音訊,涵蓋 70,000 張圖像。它專門設計用於:
- 語音辨識:訓練模型以準確轉錄口語。
- 語言建模:開發更精緻的語言模型。
- 分割任務:識別不同的語音單元以提高轉錄準確性。
AI 應用與實用性
Vaani 資料集涵蓋 54 種語言,並包含來自不同地理、教育及社會經濟背景的自發語音資料。這樣的資料廣度使得開發多種 AI 模型成為可能:
- 語音轉文字 (STT) 與文字轉語音 (TTS):為 LLM 與非 LLM 應用程式進行微調,包括語言切換的 ASR 模型(印度語和英語)。
- 基礎語音模型:基於顯著的語言與地理覆蓋,為印度語言建立穩健的模型。
- 說話者與語言識別:利用超過 80,000 位說話者的資料,開發說話者驗證與識別模型。
- 語音增強:利用資料集的標記系統,建構先進的語音增強技術。
- 多模態 LLM:結合其他資料集時,提升 LLM 的多模態能力。
- 效能基準測試:提供真實世界且多樣的資料集,用於語音模型的基準測試。
這些能力可應用於遠程醫療、醫療保健、教育工具、選民熱線及媒體本地化等實際對話式 AI 應用。