Hugging Face와 IISc가 Vaani 데이터셋을 오픈소스로 공개하기 위해 파트너십을 맺었습니다

Hugging Face는 인도 과학원(IISc)과 ARTPARK와 파트너십을 맺어 Vaani에 대한 글로벌 접근을 제공했습니다. Vaani는 인도의 언어 다양성을 대표하도록 설계된巨대한 다중 모달, 다중 언어 데이터셋입니다. 이 협력은 데이터셋의 접근성과 사용성을 높여 인도의 다양한 언어 집단의 디지털 요구를 더 잘 충족하는 AI 시스템 개발을 촉진하는 것을 목표로 합니다.

Vaani 데이터셋: 범위와 방법론

Vaani 데이터셋은 2022년 IISc/ARTPARK와 Google에 의해 시작된 오픈소스 이니셔티브입니다. 원격 지역의 방언과 언어를 수집하기 위해 지중심 접근 방식을 사용하여, 데이터가 주류 언어 이상을 대표하도록 보장합니다.

데이터 수집 목표

Vaani는 인도의 모든 773개 지구에서 1백만 명으로부터 다음 데이터 포인트를 수집하는 것을 목표로 합니다:

  • 총 음성 데이터: 150,000시간 이상.
  • 전사된 텍스트 데이터: 15,000시간.

구현 단계

  • Phase 1: 80개 지구를 다루었으며 이미 오픈소스로 공개되었습니다.
  • Phase 2: 현재 진행 중이며, 추가로 100개 지구를 포함하여 데이터셋을 확장하고 모든 인도 주를 커버하도록 범위를 확장하고 있습니다.

특수 데이터 서브셋

t특정 AI 작업을 용이하게 하기 위해 더 큰 Vaani 데이터셋의 전사된 서브셋이 오픈소스로 공개되었습니다. 이 서브셋은 약 700,000명의 화자로부터 70,000개의 이미지를 다루는 790시간의 전사된 오디오를 포함합니다. 다음과 같이 특별히 설계되었습니다:

  • 음성 인식: spoken language을 정확하게 전사하는 모델 훈련.
  • 언어 모델링: 더 정교한 언어 모델 개발.
  • 세그먼테이션 작업: 전사 정확도를 향상시키기 위해 구분된 음성 단위 식별.

AI 응용 및 유용성

Vaani 데이터셋은 54개 언어를 다루며 다양한 지리적, 교육적, 사회경제적 배경을 가진 즉흥적인 음성 데이터를 포함합니다. 이러한 데이터의 폭은 여러 종류의 AI 모델 개발을 가능하게 합니다:

  • 음성-텍스트 (STT) 및 텍스트-음성 (TTS): LLM 및 비-LLM 응용 프로그램 모두에 대한 모델 미세 조정, Indic 및 영어 코드 스위칭 ASR 모델 포함.
  • 기초 음성 모델: 상당한 언어적 및 지리적 커버리지를 기반으로 Indic 언어에 대한 견고한 모델 생성.
  • 화자 및 언어 식별: 80,000명 이상의 화자 데이터를 활용하여 화자 검증 및 식별을 위한 모델 개발.
  • 음성 향상: 데이터셋의 태깅 시스템을 활용하여 고급 음성 향상 기술 구축.
  • 멀티모달 LLM: 다른 데이터셋과 결합했을 때 LLM의 멀티모달 기능 향상.
  • 성능 벤치마킹: 음성 모델 벤치마킹을 위한 실제 세계의 다양한 데이터셋 제공. 이러한 기능은 원격 의료, 의료, 교육 도구, 유권자 헬프라인, 미디어 현지화와 같은 실제 세계의 대화형 AI 응용 프로그램에 적용할 수 있습니다.

Sources