AaronZ345/GTSinger
Dataset and code of GTSinger(NeurIPS 2024 Spotlight): A Global Multi-Technique Singing Corpus with Realistic Music Scores for All Singing Tasks
解决的问题
GTSinger 解决了 AI 歌唱模型缺乏高质量、多语言、多技术歌唱数据集的问题。它提供了一个全面的语料库,使模型不仅能学习旋律和歌词,还能学习特定的歌唱技巧和真实的音乐编排,弥合了合成歌唱与人类表达之间的差距。
如何工作
该项目提供了一个大规模数据集,包含 20 位歌手在九种语言(中文、英文、日文、韩文、俄文、西班牙文、法文、德文、意大利文)中的 80 多小时专业录音室录音。数据按语言和技术分层组织,包含以下特性:
- 受控对比: 同一首歌曲以自然方式演唱(对照组)和以特定技巧演唱(技术组)的音频对。
- 详细标注: 六种技巧(混声、假声、气声、咽音、颤音、滑音)的音素级标注,全局风格标签(情感、节奏、音域),以及手动音素-音频对齐。
- 真实乐谱: 包含规则音符时长的 MusicXML 文件,帮助模型适应现实中的音乐编排。
- 配对语音: 超过 16 小时的语音数据,用于支持语音到歌唱转换任务。
适用对象
从事歌唱语音合成(SVS)、歌唱技巧识别、风格迁移和语音到歌唱转换的研究人员和开发者。
主要亮点
- 超大规模: 拥有 80.59 小时高质量音频的全球最大录音歌唱数据集。
- 多语言支持: 覆盖九种广泛使用的语言和全部四种声区。
- 技术导向: 提供六种不同歌唱技巧的受控对比。
- 全面工具链: 包含数据分割和 JSON 生成的预处理脚本,以及合成、识别和风格迁移的基准测试。
相关
- 项目
- 项目
- 项目
- 项目
- 项目