texttron/tevatron

Tevatron - Unified Document Retrieval Toolkit across Scale, Language, and Modality. Demo in SIGIR 2023, SIGIR 2025.

解決的問題

Tevatron 提供了一個用於構建與訓練大規模神經檢索器的統一工具包。它解決了在保持計算與記憶體效率的同時,跨不同語言與模態(文本與圖像)訓練十億級基於 LLM 的檢索器的挑戰。

工作原理

該工具包允許使用者透過 LoRA 使用參數高效微調 (PEFT) 來微調預訓練模型(例如 Mistral-7B、BGE-Embedding 或 Instruct-E5)。它支援 PyTorch (GPU) 與 JAX (TPU/GPU) 後端。為了優化效能,它整合了 vLLM、DeepSpeed、FlashAttention 與 GradCache 等高效函式庫。典型的流程包括在查詢-段落對上訓練檢索器、將語料庫編碼為嵌入,並執行相似性搜尋以檢索相關文件。

適用對象

致力於稠密檢索、開放域問答與多模態搜尋系統,並需要將模型擴展至數十億文件規模的 AI 研究人員與工程師。

亮點

  • 多後端支援:相容於用於 GPU 的 PyTorch 與用於 TPU/GPU 的 JAX。
  • 規模與模態:支援跨多種語言以及文本與圖像模態的十億級檢索。
  • 效率:整合了用於參數高效微調的 LoRA 以及用於加速訓練的 DeepSpeed/FlashAttention。
  • 開箱即用的數據:包含用於多模態與多語言檢索任務的自包含 HuggingFace 資料集。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案