facebookresearch/stopes

A library for preparing data for machine translation research (monolingual preprocessing, bitext mining, etc.) built by the FAIR NLLB team.

解决的问题

stopes 是一个旨在简化机器翻译研究数据准备的库。它解决了将大规模网络数据处理为高质量训练集的挑战,特别是针对 No Language Left Behind (NLLB) 项目。

工作原理

该库由几个功能组件组成:

  • Core:一个用于编写可读且可扩展数据流水线的框架。
  • Modules:用于常见挖掘和评估任务的预构建步骤。
  • Pipelines:特定工作流程的实现,包括:
    • Monolingual:清理和预处理单语言数据。
    • Bitext:从两个单语数据集中提取对齐的句子对(全局挖掘)。
    • Distillation:通过序列级知识蒸馏,使用预训练的大型教师模型来训练小型学生模型。
  • Eval:用于评估的工具,包括无文本语音翻译评估(ALTI+ 和 BLASER)。
  • Demo:实用示例,例如挖掘演示和毒性/幻觉分析。

适用人群

从事机器翻译的研究人员和开发者,特别是那些需要处理大量网络数据以创建干净训练集或执行知识蒸馏的人员。

亮点

  • 可扩展的流水线:专为处理多语言翻译的大规模数据而构建。
  • 双语文本挖掘:包含从单语数据中提取对齐句子的工具。
  • 知识蒸馏:支持序列级蒸馏以创建高效的学生模型。
  • 语音翻译评估:提供 ALTI+ 和 BLASER 等专用工具,用于在不需要文本参考的情况下评估语音翻译。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目