Hugging Face 和 IISc 合作开源 Vaani 数据集

Hugging Face 与印度科学院(IISc)和 ARTPARK 合作,提供对 Vaani 的全球访问,Vaani 是一个旨在代表印度语言多样性的大规模多模态多语言数据集。此次合作旨在提高数据集的可访问性和可用性,以促进开发更好地满足印度多语言人口数字需求的人工智能系统。

Vaani 数据集:范围与方法

Vaani 数据集是由 IISc/ARTPARK 和 Google 在 2022 年启动的开源倡议。它采用地理中心方法从偏远地区收集方言和语言,确保数据不仅代表主流语言。

数据收集目标

Vaani 旨在从印度所有 773 个地区的 100 万人中收集以下数据点:

  • 总语音数据:超过 150,000 小时。
  • 转录文本数据:15,000 小时。

实施阶段

  • 第一阶段:已覆盖 80 个地区,并且已经开源。
  • 第二阶段:目前正在进行中,正在将数据集扩展到额外的 100 个地区,覆盖范围延伸至所有印度邦。

专门数据子集

为了便于特定的 AI 任务,更大的 Vaani 数据集的转录子集已经开源。该子集包含来自约 700,000 位说话者的 790 小时转录音频,覆盖 70,000 张图像。它专门设计用于:

  • 语音识别:训练模型以准确转录口语。
  • 语言建模:开发更精细的语言模型。
  • 分割任务:识别不同的语音单元以提高转录准确性。

AI 应用与实用性

Vaani 数据集涵盖 54 种语言,并包含来自不同地理、教育和社会经济背景的自发语音数据。这种数据广度使得可以开发多种类型的 AI 模型:

  • 语音转文本(STT)和文本转语音(TTS):针对 LLM 和非 LLM 应用进行模型微调,包括代码切换 ASR 模型(印地语和英语)。
  • 基础语音模型:基于显著的语言和地理覆盖,为印地语语言创建稳健的模型。
  • 说话人和语言识别:利用超过 80,000 位说话者的数据,开发说话人验证和识别模型。
  • 语音增强:利用数据集的标注系统构建先进的语音增强技术。
  • 多模态 LLMs:在与其他数据集结合时提高 LLMs 的多模态能力。
  • 性能基准测试:提供真实世界的多样化数据集,用于语音模型的基准测试。

这些能力可以应用于远程医疗、医疗保健、教育工具、选民热线和媒体本地化等实际对话式 AI 应用。

Sources