facebookresearch/stopes
A library for preparing data for machine translation research (monolingual preprocessing, bitext mining, etc.) built by the FAIR NLLB team.
해결하는 문제
stopes는 기계 번역 연구를 위한 데이터 준비를 간소화하기 위해 설계된 라이브러리입니다. 특히 No Language Left Behind (NLLB) 프로젝트를 위해 대규모 웹 데이터를 고품질 훈련 세트로 처리하는 과정의 과제를 해결합니다.
작동 방식
이 라이브러리는 여러 기능적 구성 요소로 구성되어 있습니다:
- Core: 읽기 쉽고 확장 가능한 데이터 파이프라인을 작성하기 위한 프레임워크.
- Modules: 일반적인 마이닝 및 평가 작업을 위한 사전 구축된 단계.
- Pipelines: 다음을 포함한 특정 워크플로우의 구현:
- Monolingual: 단일 언어 데이터 정리 및 전처리.
- Bitext: 두 개의 단일 언어 데이터셋에서 정렬된 문장 쌍 추출 (글로벌 마이닝).
- Distillation: 사전 학습된 대형 교사 모델을 사용하여 시퀀스 수준의 지식 증류를 통해 소형 학생 모델 훈련.
- Eval: 평가 도구, 텍스트가 없는 음성 번역 평가(ALTI+ 및 BLASER) 포함.
- Demo: 마이닝 데모 및 독성/환각 분석과 같은 실용적인 예제.
대상 사용자
기계 번역 작업을 하는 연구원 및 개발자. 특히 깨끗한 훈련 세트를 만들거나 지식 증류를 수행하기 위해 대량의 웹 데이터를 처리해야 하는 사용자를 위한 라이브러리입니다.
주요 특징
- 확장 가능한 파이프라인: 다국어 번역을 위한 대규모 데이터 처리를 처리하도록 구축되었습니다.
- 바이텍스트 마이닝: 단일 언어 데이터에서 정렬된 문장을 추출하는 도구가 포함되어 있습니다.
- 지식 증류: 효율적인 학생 모델을 만들기 위해 시퀀스 수준의 증류를 지원합니다.
- 음성 번역 평가: 텍스트 참조 없이 음성 번역을 평가하기 위해 ALTI+ 및 BLASER와 같은 전문 도구를 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트