darija-open-dataset/dataset

darija <-> english dataset

解决的问题

提供一个全面的开源数据集,用于摩洛哥方言(Darija),解决该特定方言在自然语言处理(NLP)领域缺乏高质量语言资源的问题。弥合 Darija 与英语之间的差距,支持阿拉伯文和拉丁文(Arabizi)两种书写系统。

如何工作

该项目汇集了经过人工审核的条目,包括语义和句法分类、动词变位以及翻译句子。提供两种主要数据格式:

  • 人工数据集:经过审核的人工条目和句子集合。
  • DODa-500K:一个大规模并行文件,包含超过 50 万行数据,结合了人工验证数据与模型生成的合成扩展数据,用于机器翻译训练。

通过 PyDODa(一个 Python 包装库)可轻松访问人工数据集,使开发者能够以编程方式获取翻译并探索语言类别。

适用人群

  • NLP 实践者:正在构建 Darija 机器翻译或语言模型的人。
  • 研究人员:研究摩洛哥方言的语言学家和 AI 研究人员。
  • 语言爱好者:对学习或分析 Darija 感兴趣的人。

主要亮点

  • 大规模:包含约 15 万条人工条目和用于 MT 训练的 50 万条并行数据集。
  • 多书写系统支持:涵盖阿拉伯文和拉丁文(Arabizi)两种字母系统。
  • 语言学深度:包含动词与名词的对应关系、阳性与阴性变化、以及详细的动词变位。
  • 开发者友好:提供专用的 Python 库(PyDODa),便于数据集成。

相关

  • 项目
  • 项目
  • 项目
  • 项目