CUNY-CL/wikipron
Massively multilingual pronunciation mining
해결하는 문제
WikiPron은 Wiktionary에서 발음 데이터를 자동으로 수집하도록 설계되었습니다. 다양한 언어에 대한 단어-발음 쌍(G2P 데이터)을 수동으로 수집하는 문제를 해결하며, 음성 합성 또는 음성 인식 시스템을 구축하는 데 필수적인 데이터를 제공합니다.
작동 방식
이 도구는 명령줄 인터페이스(CLI)와 Python API로 모두 작동합니다. 국제음성기호(IPA) 표기법을 Wiktionary에서 스크래핑하여 언어(ISO 639-3 코드로 지정), 특정 방언 지정, 광의 또는 좁은 표기 선택이 가능합니다. 또한 디아크리틱스와 수정 기호가 부모 기호와 올바르게 그룹화되도록 IPA 기호를 분할하여 기계 학습 모델링에 더 적합하게 처리합니다.
대상 사용자
음성 기술, 언어학, 자연어 처리(NLP) 분야의 연구자 및 개발자에게 적합하며, 발음 사전을 생성하는 데 사용할 수 있습니다.
주요 특징
- 다국어 지원: 348개 언어의 데이터를 추출할 수 있습니다.
- 사용자 정의 스크래핑: 방언 및 표기 수준(광의 vs. 좁은)에 따라 필터링 가능합니다.
- IPA 분할 처리:
segments라이브러리를 사용하여 모델링 목적에 적합한 IPA 디아크리틱스를 정확히 처리합니다. - 즉시 사용 가능한 데이터: 500만 개 이상의 단어-발음 쌍으로 구성된 데이터베이스를 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트