facebookresearch/stopes
A library for preparing data for machine translation research (monolingual preprocessing, bitext mining, etc.) built by the FAIR NLLB team.
解決する課題
stopes は、機械翻訳研究用のデータ準備を簡素化するために設計されたライブラリです。特に No Language Left Behind (NLLB) プロジェクト向けに、大規模なウェブデータを高品質なトレーニングセットに処理する際の課題を解決します。
仕組み
このライブラリは、いくつかの機能コンポーネントで構成されています:
- Core:読みやすくスケーラブルなデータパイプラインを記述するためのフレームワーク。
- Modules:一般的なマイニングと評価タスクのための事前構築済みステップ。
- Pipelines:特定のワークフローの実装。以下が含まれます:
- Monolingual:単一言語データのクリーニングと前処理。
- Bitext:2つの単言語データセットから整列した文ペアを抽出する(グローバルマイニング)。
- Distillation:事前学習済みの大規模な教師モデルを使用して、シーケンスレベルの知識蒸留を介して小規模な生徒モデルを訓練する。
- Eval:評価用ツール。テキストフリーの音声翻訳評価(ALTI+ および BLASER)を含む。
- Demo:マイニングデモや毒性/ハルシネーション分析などの実用的な例。
対象者
機械翻訳に取り組む研究者や開発者。特に、クリーンなトレーニングセットを作成したり、知識蒸留を実行したりするために大量のウェブデータを処理する必要がある人向けです。
ハイライト
- スケーラブルなパイプライン:多言語翻訳のための大規模データ処理を扱うために構築されています。
- バイテキストマイニング:単言語データから整列した文を抽出するツールが含まれています。
- 知識蒸留:効率的な生徒モデルを作成するためのシーケンスレベルの蒸留をサポートしています。
- 音声翻訳評価:テキスト参照を必要とせずに音声翻訳を評価するための ALTI+ や BLASER などの専門ツールを提供します。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト