mjpost/sacrebleu

Reference BLEU implementation that auto-downloads test sets and reports a version string to facilitate cross-lab comparisons

解决的问题

SacreBLEU 解决了机器翻译中计算 BLEU 分数时存在的不一致性和缺乏可复现性问题。它消除了由不同实现方式、不同的分词方法以及手动管理与下载标准测试集所带来的混乱。

工作原理

它封装了原始的 BLEU 参考实现,并提供了一种标准化的方法来计算去分词输出的分数。该工具会自动下载和处理常见的 WMT 测试集。为确保可复现性,它为每个分数生成唯一的版本签名,使研究人员能够准确传达分数的计算方式。

适用人群

需要共享、可比较且可复现的评估指标的机器翻译和自然语言处理研究人员及开发者。

主要亮点

  • 标准化指标:计算 BLEU、chrF、chrF++ 和翻译错误率(TER)。
  • 自动化数据管理:自动下载并处理常见的 WMT 测试集。
  • 语言支持:包含中文、日文(通过 MeCab)、韩文(通过 MeCab-ko)的专用分词器,以及多语言 SentencePiece 分词器。
  • 可复现性:为每个结果生成详细的版本签名,便于跨论文比较。
  • 统计分析:支持配对自助重采样和近似随机化检验,用于报告统计显著性。
  • 灵活输出:结果可输出为 JSON、文本或 LaTeX 表格格式。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目