terrier-org/pyterrier

A Python framework for performing information retrieval experiments, building on http://terrier.org/

何を解決するか

PyTerrier は、情報検索(IR)パイプラインの構築とテストのための統合フレームワークを提供します。複数のインデキシングおよび検索手法を組み合わせた複雑な検索システムの作成を簡素化し、標準データセットと評価メトリクスを使用して、その有効性を厳密に比較できるようにします。

動作方法

PyTerrier は「トランスフォーマー」アーキテクチャを採用しており、BM25 やニューラル再ランクエンジンなどの検索コンポーネントをパイプライン演算子で連結できます。これにより、高速なスパースリトリーバーから始めて、ニューラル再ランカーで結果を精緻化するような高度なワークフローを構築できます。また、ir_datasets パッケージと統合されており、実験用に標準ベンチマークを簡単に取得できます。

対象ユーザー

検索エンジン、Retrieval Augmented Generation(RAG)システム、情報検索の実験に取り組む研究者や開発者向けに設計されています。

主な特徴

  • 柔軟なパイプライン: 宣言的なアプローチでスパース、学習済みスパース、または密度型リトリーバーのパイプラインを構築可能。
  • 実験フレームワーク: nDCG や AP などのメトリクスを使用して複数のパイプラインを比較できる組み込みの pt.Experiment 関数。
  • 広範なエコシステム: ColBERT による密度型リトリーブ、MonoT5 によるニューラル再ランク、RAG 用の多数のプラグインをサポート。
  • 標準データセットの統合: ベンチマーク用に膨大な数の IR データセットへのシームレスなアクセスを提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト