PrithivirajDamodaran/FlashRank
Lite & Super-fast re-ranking for your search & retrieval pipelines. Supports SoTA Listwise and Pairwise reranking based on LLMs and cross-encoders and more. Created by Prithivi Da, open for PRs & Collaborations.
What it solves
FlashRank는 검색 결과를 대형 언어 모델(LLM)에 전달하기 전에 재정렬함으로써 검색 및 검색 결과의 품질을 향상시키기 위해 설계된 경량 Python 라이브러리입니다. 무거운 재정렬 모델 사용에 따른 오버헤드와 비용을 해결하고, 경쟁력 있는 성능을 유지하면서 빠른 CPU 기반 대안을 제공합니다.
How it works
이 라이브러리는 페어와이즈/포인트와이즈 cross‑encoder와 리스트와이즈 LLM 기반 재정렬기를 포함한 최첨단(SoTA) 재정렬기를 제공합니다. 사용자는 이러한 모델을 기존의 레키시컬, 시맨틱 또는 하이브리드 검색 파이프라인에 통합할 수 있습니다. 시스템은 속도와 메모리 사용량을 최적화했으며, Torch나 Transformers 라이브러리를 필요로 하지 않고 CPU에서 실행됩니다.
Who it’s for
검색 엔진, RAG(Retrieval‑Augmented Generation) 파이프라인 및 서버리스 배포(AWS Lambda 등)를 구축하는 개발자를 위한 것입니다. 고성능·저지연 재정렬 단계가 필요하지만 특수 하드웨어는 필요하지 않은 경우에 적합합니다.
Highlights
- Ultra-lite footprint: 기본 모델이 약 4 MB에 불과해 서버리스 환경에서 빠른 콜드 스타트를 가능하게 합니다.
- CPU-optimized: Torch나 Transformers에 의존하지 않고 CPU에서 실행됩니다.
- Diverse model support: TinyBERT, MiniLM, RankT5, 4‑bit 양자화 GGUF 모델(Rank Zephyr 등) 등 다양한 모델을 지원합니다.
- Flexible integration: 레키시컬, 시맨틱(VectorDB) 및 하이브리드 검색을 포함한 모든 검색 파이프라인과 유연하게 통합됩니다.