AaronZ345/GTSinger
Dataset and code of GTSinger(NeurIPS 2024 Spotlight): A Global Multi-Technique Singing Corpus with Realistic Music Scores for All Singing Tasks
해결하는 문제
GTSinger는 AI 가창 모델을 위한 고품질, 다국어, 다기술歌唱 데이터셋의 부족을 해결합니다. 모델이 멜로디와 가사뿐 아니라 특정 가창 기술과 현실적인 음악 구성도 학습할 수 있도록 포괄적인 코퍼스를 제공하여, 합성 가창과 인간과 같은 표현 사이의 격차를 메웁니다.
작동 방식
이 프로젝트는 9개 언어(중국어, 영어, 일본어, 한국어, 러시아어, 스페인어, 프랑스어, 독일어, 이탈리아어)의 20명의 프로 가수로부터 80시간 이상의 프로 스튜디오 녹음을 포함한 대규모 데이터셋을 제공합니다. 데이터는 언어와 기술별로 계층적으로 정리되어 있으며, 다음과 같은 특징을 갖습니다:
- 통제된 비교: 동일한 곡을 자연스럽게 부른(대조군) 후 특정 기술로 부른(기술군) 음성 쌍.
- 세부 애노테이션: 6가지 기술(믹스보이스, 팔세토, 브리시, 파라인질, 비브라토, 글리세ando)에 대한 음소 수준 애노테이션, 글로벌 스타일 레이블(감정, 속도, 음역), 수동 음소-음성 정렬.
- 현실적인 악보: 정기적인 음표 지속시간을 가진 MusicXML 파일로, 모델이 실제 음악 구성에 적응할 수 있도록 도와줍니다.
- 페어드 스피치: 16시간 이상의 스피치 데이터를 포함하여 스피치-가창 변환 작업을 지원합니다.
대상 사용자
가창 음성 합성(SVS), 가창 기술 인식, 스타일 전이, 스피치-가창 변환 작업에 종사하는 연구자 및 개발자.
주요 특징
- 대규모: 고품질 음성 80.59시간의 최대 규모 녹음 가창 데이터셋.
- 다국어 지원: 9개의 널리 쓰이는 언어와 4가지 보컬 범위를 커버.
- 기술 중심: 6가지 독특한 가창 기술에 대한 통제된 비교 제공.
- 포괄적인 도구 세트: 데이터 분할 및 JSON 생성을 위한 전처리 스크립트, 합성, 인식, 스타일 전이용 벤치마크 포함.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트