mjpost/sacrebleu
Reference BLEU implementation that auto-downloads test sets and reports a version string to facilitate cross-lab comparisons
解決的問題
SacreBLEU 解決了機器翻譯中計算 BLEU 分數時存在的不一致性和缺乏可重現性問題。它消除了因不同實作方式、不同的詞元化方法,以及手動管理與下載標準測試集所造成的混亂。
工作原理
它封裝了原始的 BLEU 參考實作,並提供一種標準化的方法來計算去詞元化輸出的分數。該工具會自動下載並處理常見的 WMT 測試集。為確保可重現性,它為每個分數生成唯一的版本簽名,使研究人員能夠準確傳達分數的計算方式。
適用對象
需要可共享、可比較且可重現的評估指標的機器翻譯與自然語言處理研究人員及開發者。
主要亮點
- 標準化指標:計算 BLEU、chrF、chrF++ 和翻譯錯誤率(TER)。
- 自動化資料管理:自動下載並處理常見的 WMT 測試集。
- 語言支援:包含中文、日文(透過 MeCab)、韓文(透過 MeCab-ko)的專用詞元化器,以及多語言 SentencePiece 詞元化器。
- 可重現性:為每個結果生成詳細的版本簽名,便於跨論文比較。
- 統計分析:支援配對自助重採樣與近似隨機化檢定,用於報告統計顯著性。
- 靈活輸出:結果可輸出為 JSON、文字或 LaTeX 表格格式。
相關
- 專案
- 專案
- 專案
- 專案
- 專案