AaronZ345/GTSinger

Dataset and code of GTSinger(NeurIPS 2024 Spotlight): A Global Multi-Technique Singing Corpus with Realistic Music Scores for All Singing Tasks

何を解決するか

GTSingerは、AI歌唱モデル向けの高品質で多言語・多技術の歌唱データセットが不足している問題に対処します。モデルがメロディーや歌詞だけでなく、特定の歌唱技術や現実的な音楽構成を学べる包括的なコーパスを提供し、合成歌唱と人間のような表現との間のギャップを埋めます。

どう動くか

本プロジェクトは、9言語(中国語、英語、日本語、韓国語、ロシア語、スペイン語、フランス語、ドイツ語、イタリア語)の20人のプロ歌手による80時間以上のプロスタジオ録音を含む大規模データセットを提供します。データは言語と技術ごとに階層的に整理されており、以下の特徴を備えています:

  • 制御された比較: 同じ曲を自然に歌った(コントロール群)と特定の技術で歌った(技術群)の音声ペア。
  • 詳細なアノテーション: 6つの技術(ミックスボイス、ファルセット、ブレス、ファリゲアル、ビブラート、グリッサンド)の音素レベルアノテーション、グローバルスタイルラベル(感情、速度、音域)、手動による音素-音声同期アライメント。
  • 現実的な楽譜: 定期的な音符長さを持つMusicXMLファイルで、モデルが現実の音楽構成に適応できるように支援します。
  • ペアドスピーチ: 歌唱への変換タスクをサポートするための16時間以上のスピーチデータ。

対象ユーザー

歌唱音声合成(SVS)、歌唱技術認識、スタイル転送、スピーチから歌唱への変換に取り組む研究者および開発者。

特徴

  • 大規模: 高品質音声80.59時間の最大規模の録音歌唱データセット。
  • 多言語対応: 9つの広く使われる言語と4つの声域をカバー。
  • 技術中心: 6つの異なる歌唱技術に対する制御された比較を提供。
  • 包括的なツールキット: データ分割とJSON生成のための前処理スクリプト、合成、認識、スタイル転送のベンチマークを含む。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト