mjpost/sacrebleu

Reference BLEU implementation that auto-downloads test sets and reports a version string to facilitate cross-lab comparisons

何を解決するか

SacreBLEU は機械翻訳における BLEU スコアの計算における一貫性の欠如と再現性のなさを解決します。異なる実装、さまざまなトークン化方法、標準テストセットの管理・ダウンロードに必要な手作業による「混乱」を排除します。

仕組み

オリジナルの BLEU 参照実装をラップし、デトークン化された出力上でスコアを標準化された方法で計算します。このツールは一般的な WMT テストセットのダウンロードと処理を自動的に行います。再現性を確保するために、各スコアに対して一意のバージョン署名を出力し、研究者がスコアの計算方法を正確に共有できるようにします。

対象ユーザー

機械翻訳および自然言語処理に取り組む研究者や開発者で、共有可能で比較可能かつ再現可能な評価指標が必要な方々。

特徴

  • 標準化された指標: BLEU、chrF、chrF++、および翻訳エラー率(TER)を計算。
  • 自動データ管理: 一般的な WMT テストセットを自動的にダウンロードおよび処理。
  • 言語対応: 中国語、日本語(MeCab を経由)、韓国語(MeCab-ko を経由)の専用トークン化器を含み、マルチリンガル SentencePiece トークン化器もサポート。
  • 再現性: 各結果に対して詳細なバージョン署名を生成し、論文間の比較を容易にします。
  • 統計解析: 対応ブートストラップ再サンプリングと近似的なランダム化検定をサポートし、統計的有意性を報告可能。
  • 柔軟な出力形式: JSON、テキスト、LaTeX テーブル形式で結果を出力可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト