darija-open-dataset/dataset
darija <-> english dataset
해결하는 문제
모로코 방언(Darija)을 위한 포괄적이고 오픈소스 데이터셋을 제공하여, 이 특정 방언에 대한 자연어 처리(NLP)를 위한 고품질 언어 자원의 부족을 해결합니다. Darija와 영어 사이의 격차를 메우며, 아랍 문자와 라틴 문자(Arabizi) 표기 모두를 지원합니다.
작동 방식
프로젝트는 의미적·구문적 분류, 동사 활용, 번역된 문장 등을 포함한 인간이 검증한 항목을 수집합니다. 주로 두 가지 주요 데이터 형식을 제공합니다:
- 인간 데이터셋: 검토된 인간의 항목과 문장 모음.
- DODa-500K: 50만 건 이상의 행을 포함하는 대규모 병렬 파일로, 인간 검증 데이터와 모델 생성 합성 확장 데이터를 결합하여 기계 번역 훈련에 사용합니다.
인간 데이터셋에 접근하기 위해 PyDODa라는 Python 래퍼 라이브러리를 제공하며, 개발자가 프로그래밍 방식으로 번역을 가져오고 언어적 카테고리를 탐색할 수 있습니다.
대상 사용자
- NLP 실무자: Darija용 기계 번역 또는 언어 모델을 개발하는 사람.
- 연구자: 모로코 방언을 연구하는 언어학자 및 AI 연구자.
- 언어 애호가: Darija를 배우거나 분석하고 싶은 사람.
주요 특징
- 대규모: 약 15만 건의 인간 항목과 MT 훈련용 50만 건의 병렬 데이터셋 포함.
- 다중 스크립트 지원: 아랍 문자와 라틴 문자(Arabizi) 모두를 커버.
- 언어학적 깊이: 동사-명사 대응, 남성형-여성형 변형, 자세한 동사 활용 포함.
- 개발자 친화적: 데이터 통합을 쉽게 해주는 전용 Python 라이브러리(PyDODa) 제공.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트