jitsi/jiwer

Evaluate your speech-to-text system with similarity measures such as word error rate (WER)

What it solves

予測テキスト(hypothesis)と正解データ(ground-truth reference)を比較することで、自動音声認識 (ASR) システムの精度を評価するための、高速かつシンプルな方法を提供します。

How it works

本ライブラリは、参照文と仮説文の間の最小編集距離を計算します。C++ ベースの実装である RapidFuzz を使用することで、高速なパフォーマンスを実現し、純粋な Python 実装の遅さを回避します。

Who it’s for

標準的な業界指標を用いて文字起こし精度を測定する必要がある、音声からテキストへのモデル開発者および研究者です。

Highlights

  • 複数の評価指標をサポート:Word Error Rate (WER)、Match Error Rate (MER)、Word Information Lost (WIL)、Word Information Preserved (WIP)、および Character Error Rate (CER)。
  • RapidFuzz を介してバックエンドで C++ を使用し、速度を最適化しています。
  • 空の参照文字列を処理できるため、 静音オーディオにおけるモデルのハルシネーション(幻覚)のテストが可能です。