darija-open-dataset/dataset

darija <-> english dataset

何を解決するか

モロッコ方言(ダリジャ)向けの包括的でオープンソースのデータセットを提供し、この特定の方言における自然言語処理(NLP)のための高品質な言語リソースの不足に対処します。ダリジャと英語の間のギャップを埋め、アラビア文字およびラテン文字(アラビジ)表記をサポートします。

仕組み

プロジェクトは、意味的・構文的分類、動詞活用、翻訳された文を含む人間が検証したエントリを収集しています。主に以下の2つのデータ形式を提供しています:

  • 人間データセット:レビュー済みの人間によるエントリと文のコレクション。
  • DODa-500K:50万行を超える大規模な並列ファイルで、人間による検証済みデータとモデル生成による合成拡張データを組み合わせ、機械翻訳のトレーニングに使用します。

人間データセットへのアクセスは、PyDODa というPythonラッパー・ライブラリを通じて可能で、開発者がプログラム的に翻訳を取得し、言語的カテゴリを探索できます。

対象ユーザー

  • NLP実務者:ダリジャ向けの機械翻訳や言語モデルを構築している人。
  • 研究者:モロッコ方言を研究する言語学者やAI研究者。
  • 言語愛好家:ダリジャを学びたい、または分析したい人。

特徴

  • 大規模:約15万件の人間エントリと、MTトレーニング用の50万件の並列データセットを含む。
  • マルチスクリプト対応:アラビア文字とラテン文字(アラビジ)の両方をカバー。
  • 言語学的深さ:動詞と名詞の対応、男性形と女性形の変化、詳細な動詞活用を含む。
  • 開発者向け:データ統合を容易にする専用のPythonライブラリ(PyDODa)を提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト