AaronZ345/GTSinger
Dataset and code of GTSinger(NeurIPS 2024 Spotlight): A Global Multi-Technique Singing Corpus with Realistic Music Scores for All Singing Tasks
解決的問題
GTSinger 解決了 AI 歌唱模型缺乏高品質、多語言、多技術歌唱資料集的問題。它提供一個全面的語料庫,讓模型不僅能學習旋律與歌詞,還能學習特定的歌唱技巧與真實的音樂編排,彌補合成歌唱與人類表達之間的差距。
如何運作
本專案提供一個大規模資料集,包含 20 位歌手在九種語言(中文、英文、日文、韓文、俄文、西班牙文、法文、德文、義大利文)中的 80 多小時專業錄音室錄音。資料按語言與技術分層組織,包含以下特性:
- 受控對比: 同一首歌曲以自然方式演唱(對照組)與以特定技巧演唱(技術組)的音訊對。
- 詳細標註: 六種技巧(混聲、假聲、氣聲、咽音、顫音、滑音)的音素級標註,全局風格標籤(情感、節奏、音域),以及手動音素-音訊對齊。
- 真實樂譜: 包含規則音符時長的 MusicXML 檔案,幫助模型適應現實中的音樂編排。
- 配對語音: 超過 16 小時的語音資料,用於支援語音到歌唱轉換任務。
適用對象
從事歌唱語音合成(SVS)、歌唱技巧辨識、風格轉移與語音到歌唱轉換的研究人員與開發者。
主要亮點
- 超大規模: 擁有 80.59 小時高品質音訊的全球最大錄音歌唱資料集。
- 多語言支援: 覆蓋九種廣泛使用的語言與全部四種聲區。
- 技術導向: 提供六種不同歌唱技巧的受控對比。
- 全面工具鏈: 包含資料分割與 JSON 產生的預處理腳本,以及合成、辨識與風格轉移的基準測試。
相關
- 專案
- 專案
- 專案
- 專案
- 專案