texttron/tevatron

Tevatron - Unified Document Retrieval Toolkit across Scale, Language, and Modality. Demo in SIGIR 2023, SIGIR 2025.

解决的问题

Tevatron 提供了一个用于构建和训练大规模神经检索器的统一工具包。它解决了在保持计算和内存效率的同时,跨不同语言和模态(文本和图像)训练十亿级基于 LLM 的检索器的挑战。

工作原理

该工具包允许用户通过 LoRA 使用参数高效微调 (PEFT) 来微调预训练模型(例如 Mistral-7B、BGE-Embedding 或 Instruct-E5)。它支持 PyTorch (GPU) 和 JAX (TPU/GPU) 后端。为了优化性能,它集成了 vLLM、DeepSpeed、FlashAttention 和 GradCache 等高效库。典型的工作流程包括在查询-段落对上训练检索器、将语料库编码为嵌入,并执行相似性搜索以检索相关文档。

适用对象

致力于稠密检索、开放域问答和多模态搜索系统,并需要将其模型扩展到数十亿文档规模的 AI 研究人员和工程师。

亮点

  • 多后端支持:兼容用于 GPU 的 PyTorch 和用于 TPU/GPU 的 JAX。
  • 规模与模态:支持跨多种语言以及文本和图像模态的十亿级检索。
  • 效率:集成了用于参数高效微调的 LoRA 以及用于加速训练的 DeepSpeed/FlashAttention。
  • 开箱即用的数据:包含用于多模态和多语言检索任务的自包含 HuggingFace 数据集。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目