IntelLabs/RAG-FiT

Framework for enhancing LLMs for RAG tasks using fine-tuning.

What it solves

RAG‑FiT は、特別に作成された RAG 拡張データセット上でモデルをファインチューニングするための構造化フレームワークを提供し、Large Language Models(LLM)が外部情報を活用する能力を向上させます。

How it works

このライブラリは 4 つのモジュラーコンポーネントに分かれています:

  • Dataset Creation:RAG のやり取りを永続化してトレーニングデータを生成します。データのロード、外部ツールからの取得、プロンプト作成を含み、モデルに依存しない形式で保存されます。
  • Training:Parameter‑Efficient Fine‑Tuning(PEFT)と TRL(例:supervised fine‑tuning)を用いて、拡張データセット上でモデルを学習させます。
  • Inference:拡張データセット上で、学習済みまたは未学習の LLM を使用して予測を生成します。
  • Evaluation:RAGAS、Deepeval、BERTScore、ROUGE など、取得結果・推論・引用を分析できる RAG 固有の指標を用いて性能を測定します。

Who it’s for

外部データ上での LLM の性能を向上させるために、さまざまな RAG 設定、データ選択、ファインチューニング戦略をプロトタイプ・実験したい開発者や研究者向けです。

Highlights

  • Modular Workflow:処理、トレーニング、推論、評価のためのスクリプトが分離されています。
  • Cofiguration-as-Code:階層型設定に Hydra を使用し、CLI での簡単なオーバーライドや SLURM、Ray などのリモートジョブランナーとの統合が可能です。
  • Cofiguration-as-Code:Hydra を使用した階層型設定により、CLI で値を簡単にオーバーライドできます。
  • RAG‑Specific Metrics:取得と生成の品質を評価するローカルおよびグローバル指標をサポートします。
  • PEFT Support:パラメータ効率的手法により、モデルのトレーニングを効率化します。