ConardLi/easy-dataset
A powerful tool for creating datasets for LLM fine-tuning 、RAG and Eval
What it solves
Easy Dataset은 비구조화된 도메인 특화 문서에서 대형 언어 모델(LLM)용 고품질 구조화 데이터셋을 만드는 복잡한 과정을 단순화합니다. 파일 파싱, 텍스트 분할, 모델 파인튜닝, RAG 및 성능 평가에 필요한 질문‑답변 쌍 생성과 같은 수작업을 없애줍니다.
How it works
이 도구는 시각적 인터페이스를 제공하여 사용자를 데이터 파이프라인으로 안내합니다: PDF, DOCX 등 다양한 문서 형식을 파싱하고, 지능형 알고리즘으로 텍스트를 의미 있는 청크로 나눈 뒤, LLM API를 활용해 질문, 포괄적인 답변(Chain of Thought 포함) 및 도메인 라벨 트리를 자동 생성합니다. 또한 데이터 노이즈 정화 시스템과 평가 모델 또는 인간 블라인드 테스트를 통한 데이터셋 품질 평가 기능을 포함합니다.
Who it’s for
LLM 파인튜닝용 특화 데이터셋을 구축하거나 RAG 재현율을 높이거나 수직 도메인 모델 평가를 수행해야 하는 기술 사용자와 비기술 사용자 모두를 위해 설계되었습니다.
Highlights
- Comprehensive Document Support: Handles PDF, Markdown, DOCX, TXT, and EPUB with intelligent recognition.
- Diverse Dataset Types: Supports single-turn QA, multi-turn dialogues, and image-based QA datasets.
- Integrated Evaluation: Features automated scoring via Judge Models and a double-blind "Arena" for human comparison.
- Seamless Integration: One-click configuration for LLaMA Factory and direct upload capabilities to Hugging Face Hub.
- Flexible Model Support: Compatible with any OpenAI-format API, including local models via Ollama.