facebookresearch/stopes

A library for preparing data for machine translation research (monolingual preprocessing, bitext mining, etc.) built by the FAIR NLLB team.

解決的問題

stopes 是一個旨在簡化機器翻譯研究資料準備的函式庫。它解決了將大規模網路資料處理為高品質訓練集的挑戰,特別是針對 No Language Left Behind (NLLB) 專案。

運作方式

該函式庫由數個功能組件組成:

  • Core:一個用於編寫可讀且可擴充資料管線的框架。
  • Modules:用於常見挖掘和評估任務的預建步驟。
  • Pipelines:特定工作流程的實作,包括:
    • Monolingual:清理和預處理單一語言資料。
    • Bitext:從兩個單語資料集中提取對齊的句子對(全域挖掘)。
    • Distillation:透過序列級知識蒸發,使用預先訓練的大型教師模型來訓練小型學生模型。
  • Eval:用於評估的工具,包含無文字語音翻譯評估(ALTI+ 和 BLASER)。
  • Demo:實用範例,例如挖掘示範和毒性/幻覺分析。

適用對象

從事機器翻譯的研究人員和開發者,特別是那些需要處理大量網路資料以建立乾淨訓練集或執行知識蒸發的人員。

亮點

  • 可擴充的管線:專為處理多語言翻譯的大規模資料處理而建構。
  • 雙語資料挖掘:包含從單語資料中提取對齊句子的工具。
  • 知識蒸發:支援序列級蒸發以建立高效的學生模型。
  • 語音翻譯評估:提供 ALTI+ 和 BLASER 等專用工具,用於在不需要文字參考的情況下評估語音翻譯。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案