Hugging Face と IISc が Vaani データセットのオープンソース化にパートナーシップを結ぶ
Hugging Face は、インド科学研究所(IISc)および ARTPARK と提携し、インドの言語的多様性を表現するように設計された巨大なマルチモーダル・マルチリンガルデータセット Vaani へのグローバルなアクセスを提供しています。このコラボレーションは、データセットのアクセシビリティと使いやすさを向上させ、インドの多様な言語人口のデジタルニーズにさらに応える AI システムの開発を促進することを目的としています。
Vaani データセット: 範囲と方法論
Vaani データセットは、2022 に IISc/ARTPARK と Google によって開始されたオープンソース イニシアティブです。地理中心のアプローチを用いて、遠隔地域の方言と言語を収集し、データが主流言語だけでなくそれ以上を代表することを確保しています。
データ収集の目標
Vaani は、インドの全 773 地区の 100 万人から以下のデータポイントを収集することを目指しています:
- 総音声データ: 150,000 時間以上。
- 転写テキストデータ: 15,000 時間。
実装フェーズ
- Phase 1: 80 地区をカバーし、すでにオープンソース化されています。
- Phase 2: 現在進行中で、データセットを追加の 100 地区に拡張し、インド全州をカバーする範囲を広げています。
特殊なデータサブセット
特定の AI タスクを容易にするため、より大きな Vaani データセットの転写サブセットがオープンソース化されました。このサブセットは、約 70 万人の話者から得られた 790 時間の転写音声と 70,000 枚の画像を含んでいます。以下のために特別に設計されています:
- 音声認識: 話された言語を正確に転写するモデルのトレーニング。
- 言語モデリング: より洗練された言語モデルの開発。
- セグメンテーション タスク: 転写精度を向上させるために異なる音声単位を特定。
AI の応用とユーティリティ
Vaani データセットは 54 の言語をカバーし、多様な地理的、教育的、社会経済的背景からの自然な音声データを含んでいます。このデータの幅広さにより、いくつかのタイプの AI モデルの開発が可能になります:
- Speech-to-Text (STT) と Text-to-Speech (TTS): LLM および非 LLM アプリケーション両方のモデルのファインチューニング、コードスイッチング ASR モデル(Indic および English)を含む。
- Foundational Speech Models: 重要な言語的および地理的カバレッジに基づき、Indic 言語の堅牢なモデルを作成。
- Speaker and Language Identification: 80,000 人以上の話者のデータを利用して、話者検証および識別のためのモデルを開発。
- Speech Enhancement: データセットのタグ付けシステムを利用して、高度な音声強調技術を構築。
- Multimodal LLMs: 他のデータセットと組み合わせることで、LLM のマルチモーダル機能を向上。
- Performance Benchmarking: 音声モデルのベンチマークに使用できる実際の多様なデータセットを提供。
これらの機能は、テレメディシン、ヘルスケア、教育ツール、有権者ヘルプライン、メディアローカライズなどの実際の会話型 AI アプリケーションに適用できます。