IntelLabs/RAG-FiT

Framework for enhancing LLMs for RAG tasks using fine-tuning.

What it solves

RAG‑FiT는 특별히 만든 RAG 증강 데이터셋에 모델을 파인튜닝하기 위한 구조화된 프레임워크를 제공하여, 대형 언어 모델(LLM)이 외부 정보를 활용하는 능력을 향상시킵니다.

How it works

이 라이브러리는 네 개의 모듈형 컴포넌트로 구성됩니다:

  • Dataset Creation: RAG 상호작용을 영속화하여 학습 데이터를 생성합니다. 데이터 로드, 외부 도구에서의 검색, 프롬프트 생성 등을 포함하며, 모델에 독립적인 형식으로 저장됩니다.
  • Training: Parameter‑Efficient Fine‑Tuning(PEFT)과 TRL(예: supervised fine‑tuning)을 사용해 증강 데이터셋에서 모델을 학습합니다.
  • Inference: 학습된 모델이든 학습되지 않은 모델이든 증강 데이터셋을 사용해 예측을 생성합니다.
  • Evaluation: RAGAS, Deepeval, BERTScore, ROUGE 등 검색 결과, 추론, 인용을 분석할 수 있는 다양한 RAG 전용 메트릭을 활용해 성능을 측정합니다.

Who it’s for

외부 데이터에 대한 LLM 성능을 향상시키기 위해 다양한 RAG 구성, 데이터 선택 및 파인튜닝 전략을 프로토타이핑하고 실험하고자 하는 개발자와 연구자를 위한 것입니다.

Highlights

  • Modular Workflow: 처리, 학습, 추론, 평가를 위한 스크립트가 별도로 제공됩니다.
  • Cofiguration-as-Code: 계층형 설정을 위해 Hydra를 사용하며, CLI를 통한 손쉬운 오버라이드와 SLURM, Ray와 같은 원격 작업 실행기와의 통합을 지원합니다.
  • Cofiguration-as-Code: Hydra를 사용한 계층형 설정으로 CLI에서 값을 쉽게 오버라이드할 수 있습니다.
  • RAG‑Specific Metrics: 검색 및 생성 품질을 평가하기 위한 로컬 및 글로벌 메트릭을 지원합니다.
  • PEFT Support: 파라미터 효율적인 방법을 통해 모델 학습을 효율화합니다.