darija-open-dataset/dataset
darija <-> english dataset
解决的问题
提供一个全面的开源数据集,用于摩洛哥方言(Darija),解决该特定方言在自然语言处理(NLP)领域缺乏高质量语言资源的问题。弥合 Darija 与英语之间的差距,支持阿拉伯文和拉丁文(Arabizi)两种书写系统。
如何工作
该项目汇集了经过人工审核的条目,包括语义和句法分类、动词变位以及翻译句子。提供两种主要数据格式:
- 人工数据集:经过审核的人工条目和句子集合。
- DODa-500K:一个大规模并行文件,包含超过 50 万行数据,结合了人工验证数据与模型生成的合成扩展数据,用于机器翻译训练。
通过 PyDODa(一个 Python 包装库)可轻松访问人工数据集,使开发者能够以编程方式获取翻译并探索语言类别。
适用人群
- NLP 实践者:正在构建 Darija 机器翻译或语言模型的人。
- 研究人员:研究摩洛哥方言的语言学家和 AI 研究人员。
- 语言爱好者:对学习或分析 Darija 感兴趣的人。
主要亮点
- 大规模:包含约 15 万条人工条目和用于 MT 训练的 50 万条并行数据集。
- 多书写系统支持:涵盖阿拉伯文和拉丁文(Arabizi)两种字母系统。
- 语言学深度:包含动词与名词的对应关系、阳性与阴性变化、以及详细的动词变位。
- 开发者友好:提供专用的 Python 库(PyDODa),便于数据集成。
相关
- 项目
- 项目
- 项目
- 项目