darija-open-dataset/dataset

darija <-> english dataset

解決的問題

提供一個全面的開源資料集,針對摩洛哥方言(Darija),解決此特定方言在自然語言處理(NLP)領域缺乏高品質語言資源的問題。彌補 Darija 與英語之間的差距,支援阿拉伯文與拉丁文(Arabizi)兩種書寫系統。

如何運作

本專案匯集經過人工審核的條目,包含語意與句法分類、動詞變位以及翻譯句子。提供兩種主要資料格式:

  • 人工資料集:經過審核的人工條目與句子集合。
  • DODa-500K:一個大規模平行檔案,包含超過 50 萬筆資料,結合人工驗證資料與模型生成的合成擴充資料,用於機器翻譯訓練。

透過 PyDODa(一個 Python 包裝函式庫)可輕鬆存取人工資料集,讓開發者能以程式方式取得翻譯並探索語言類別。

適用對象

  • NLP 實務者:正在建構 Darija 機器翻譯或語言模型的人。
  • 研究人員:研究摩洛哥方言的語言學家與 AI 研究人員。
  • 語言愛好者:對學習或分析 Darija 感興趣的人。

主要亮點

  • 大規模:包含約 15 萬筆人工條目與用於 MT 訓練的 50 萬筆平行資料集。
  • 多書寫系統支援:涵蓋阿拉伯文與拉丁文(Arabizi)兩種字母系統。
  • 語言學深度:包含動詞與名詞的對應關係、陽性與陰性變化,以及詳細的動詞變位。
  • 開發者友善:提供專用的 Python 函式庫(PyDODa),便於資料整合。

相關

  • 專案
  • 專案
  • 專案
  • 專案