darija-open-dataset/dataset
darija <-> english dataset
何を解決するか
モロッコ方言(ダリジャ)向けの包括的でオープンソースのデータセットを提供し、この特定の方言における自然言語処理(NLP)のための高品質な言語リソースの不足に対処します。ダリジャと英語の間のギャップを埋め、アラビア文字およびラテン文字(アラビジ)表記をサポートします。
仕組み
プロジェクトは、意味的・構文的分類、動詞活用、翻訳された文を含む人間が検証したエントリを収集しています。主に以下の2つのデータ形式を提供しています:
- 人間データセット:レビュー済みの人間によるエントリと文のコレクション。
- DODa-500K:50万行を超える大規模な並列ファイルで、人間による検証済みデータとモデル生成による合成拡張データを組み合わせ、機械翻訳のトレーニングに使用します。
人間データセットへのアクセスは、PyDODa というPythonラッパー・ライブラリを通じて可能で、開発者がプログラム的に翻訳を取得し、言語的カテゴリを探索できます。
対象ユーザー
- NLP実務者:ダリジャ向けの機械翻訳や言語モデルを構築している人。
- 研究者:モロッコ方言を研究する言語学者やAI研究者。
- 言語愛好家:ダリジャを学びたい、または分析したい人。
特徴
- 大規模:約15万件の人間エントリと、MTトレーニング用の50万件の並列データセットを含む。
- マルチスクリプト対応:アラビア文字とラテン文字(アラビジ)の両方をカバー。
- 言語学的深さ:動詞と名詞の対応、男性形と女性形の変化、詳細な動詞活用を含む。
- 開発者向け:データ統合を容易にする専用のPythonライブラリ(PyDODa)を提供。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト