IntelLabs/RAG-FiT

Framework for enhancing LLMs for RAG tasks using fine-tuning.

What it solves

RAG‑FiT 透過提供結構化的框架,讓大型語言模型(LLM)在特別製作的 RAG 增強資料集上進行微調,從而提升其利用外部資訊的能力。

How it works

此函式庫分為四個模組化元件:

  • Dataset Creation:透過持久化 RAG 互動產生訓練資料,包含資料載入、從外部工具檢索以及提示詞產生。資料會以與模型無關的格式儲存。
  • Training:使用參數效率微調(PEFT)與 TRL(例如 supervised fine‑tuning)在增強資料集上訓練模型。
  • Inference:在增強資料集上使用已訓練或未訓練的 LLM 產生預測。
  • Evaluation:利用各種 RAG 專屬指標(如 RAGAS、Deepeval、BERTScore、ROUGE)衡量效能,這些指標可分析檢索結果、推理與引用。

Who it’s for

適合想要原型設計與實驗不同 RAG 配置、資料選取與微調策略,以提升 LLM 在外部資料上表現的開發者與研究者。

Highlights

  • Modular Workflow:提供獨立的腳本處理、訓練、推論與評估。
  • Cofiguration-as-Code:使用 Hydra 進行階層式設定,允許透過 CLI 輕鬆覆寫,並可與 SLURM、Ray 等遠端工作排程整合。
  • Cofiguration-as-Code:使用 Hydra 進行階層式設定,允許在 CLI 中輕鬆覆寫值。
  • RAG‑Specific Metrics:支援本地與全域指標,以評估檢索與生成的品質。
  • PEFT Support:透過參數效率方法,使模型訓練更為高效。