facebookresearch/stopes

A library for preparing data for machine translation research (monolingual preprocessing, bitext mining, etc.) built by the FAIR NLLB team.

解決する課題

stopes は、機械翻訳研究用のデータ準備を簡素化するために設計されたライブラリです。特に No Language Left Behind (NLLB) プロジェクト向けに、大規模なウェブデータを高品質なトレーニングセットに処理する際の課題を解決します。

仕組み

このライブラリは、いくつかの機能コンポーネントで構成されています:

  • Core:読みやすくスケーラブルなデータパイプラインを記述するためのフレームワーク。
  • Modules:一般的なマイニングと評価タスクのための事前構築済みステップ。
  • Pipelines:特定のワークフローの実装。以下が含まれます:
    • Monolingual:単一言語データのクリーニングと前処理。
    • Bitext:2つの単言語データセットから整列した文ペアを抽出する(グローバルマイニング)。
    • Distillation:事前学習済みの大規模な教師モデルを使用して、シーケンスレベルの知識蒸留を介して小規模な生徒モデルを訓練する。
  • Eval:評価用ツール。テキストフリーの音声翻訳評価(ALTI+ および BLASER)を含む。
  • Demo:マイニングデモや毒性/ハルシネーション分析などの実用的な例。

対象者

機械翻訳に取り組む研究者や開発者。特に、クリーンなトレーニングセットを作成したり、知識蒸留を実行したりするために大量のウェブデータを処理する必要がある人向けです。

ハイライト

  • スケーラブルなパイプライン:多言語翻訳のための大規模データ処理を扱うために構築されています。
  • バイテキストマイニング:単言語データから整列した文を抽出するツールが含まれています。
  • 知識蒸留:効率的な生徒モデルを作成するためのシーケンスレベルの蒸留をサポートしています。
  • 音声翻訳評価:テキスト参照を必要とせずに音声翻訳を評価するための ALTI+ や BLASER などの専門ツールを提供します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト