IntelLabs/RAG-FiT

Framework for enhancing LLMs for RAG tasks using fine-tuning.

What it solves

RAG‑FiT 通过提供结构化的框架,让大型语言模型(LLM)在专门制作的 RAG 增强数据集上进行微调,从而提升其利用外部信息的能力。

How it works

该库组织为四个模块化组件:

  • Dataset Creation:通过持久化 RAG 交互生成训练数据,包括数据加载、从外部工具检索以及提示词创建。数据以模型无关的格式保存。
  • Training:使用参数高效微调(PEFT)和 TRL(例如 supervised fine‑tuning)在增强数据集上训练模型。
  • Inference:在增强数据集上使用已训练或未训练的 LLM 生成预测。
  • Evaluation:使用多种 RAG 专用指标(如 RAGAS、Deepeval、BERTScore、ROUGE)衡量性能,这些指标可以分析检索结果、推理和引用。

Who it’s for

适用于想要原型设计和实验不同 RAG 配置、数据选择以及微调策略,以提升 LLM 在外部数据上表现的开发者和研究者。

Highlights

  • Modular Workflow:提供独立的脚本用于处理、训练、推理和评估。
  • Cofiguration-as-Code:使用 Hydra 进行层级配置,允许通过 CLI 轻松覆盖,并可与 SLURM、Ray 等远程作业调度器集成。
  • Cofiguration-as-Code:使用 Hydra 进行层级配置,允许在 CLI 中轻松覆盖值。
  • RAG‑Specific Metrics:支持本地和全局指标,以评估检索和生成的质量。
  • PEFT Support:通过参数高效方法,使模型训练更高效。