terrier-org/pyterrier

A Python framework for performing information retrieval experiments, building on http://terrier.org/

해결하는 문제

PyTerrier는 정보 검색(IR) 파이프라인을 구축하고 테스트하기 위한 통합 프레임워크를 제공합니다. 다양한 인덱싱 및 검색 방법을 결합하는 복잡한 검색 시스템을 쉽게 만들 수 있으며, 표준 데이터셋과 평가 지표를 사용하여 효과를 엄격히 비교할 수 있도록 합니다.

작동 방식

PyTerrier는 BM25 또는 신경망 재정렬기와 같은 검색 컴포넌트를 파이프라인 연산자로 연결할 수 있는 '트랜스포머' 아키텍처를 사용합니다. 이를 통해 빠른 스파스 리트리버로 시작하여 신경망 재정렬기로 결과를 개선하는 등의 고도화된 워크플로우를 구축할 수 있습니다. 또한 ir_datasets 패키지와 통합되어 실험용 표준 벤치마크를 쉽게 가져올 수 있습니다.

대상 사용자

검색 엔진, 검색 증강 생성(RAG) 시스템, 정보 검색 실험에 종사하는 연구자 및 개발자에게 적합합니다.

주요 특징

  • 유연한 파이프라인: 선언적 접근 방식으로 스파스, 학습된 스파스, 또는 밀도형 리트리버 파이프라인을 구축 가능.
  • 실험 프레임워크: nDCG 및 AP와 같은 메트릭을 사용해 여러 파이프라인을 비교할 수 있는 내장된 pt.Experiment 함수.
  • 풍부한 생태계: 밀도형 리트리브(ColBERT), 신경망 재정렬(MonoT5), RAG용 다양한 플러그인을 지원.
  • 표준 데이터셋 통합: 벤치마킹을 위한 방대한 IR 데이터셋 컬렉션에 원활하게 접근 가능.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트