mjpost/sacrebleu
Reference BLEU implementation that auto-downloads test sets and reports a version string to facilitate cross-lab comparisons
해결하는 문제
SacreBLEU는 기계 번역에서 BLEU 점수를 계산할 때 발생하는 일관성 부족과 재현성 부족을 해결합니다. 다양한 구현 방식, 다른 토큰화 방법, 그리고 표준 테스트 세트를 수동으로 관리하고 다운로드해야 하는 번거로움을 제거합니다.
작동 방식
원본 BLEU 참조 구현을 래핑하고, 디토큰화된 출력에서 표준화된 방식으로 점수를 계산합니다. 이 도구는 일반적인 WMT 테스트 세트를 자동으로 다운로드하고 처리합니다. 재현성을 보장하기 위해 각 점수에 대해 고유한 버전 서명을 출력하여 연구자들이 점수 계산 방법을 정확히 공유할 수 있도록 합니다.
대상 사용자
기계 번역 및 자연어 처리 작업을 수행하며 공유 가능하고 비교 가능하며 재현 가능한 평가 지표가 필요한 연구자 및 개발자들입니다.
주요 특징
- 표준화된 지표: BLEU, chrF, chrF++, 번역 오류율(TER)을 계산합니다.
- 자동 데이터 관리: 일반적인 WMT 테스트 세트를 자동으로 다운로드하고 처리합니다.
- 언어 지원: 중국어, 일본어(MeCab를 통해), 한국어(MeCab-ko를 통해) 전용 토크나이저를 포함하며, 다국어 SentencePiece 토크나이저도 지원합니다.
- 재현성: 각 결과에 대해 상세한 버전 서명을 생성하여 논문 간 비교를 용이하게 합니다.
- 통계 분석: 쌍별 부트스트랩 재표본 추출과 근사적 무작위화 검정을 지원하여 통계적 유의성을 보고할 수 있습니다.
- 유연한 출력 형식: 결과를 JSON, 텍스트, LaTeX 테이블 형식으로 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트