ConardLi/easy-dataset
A powerful tool for creating datasets for LLM fine-tuning 、RAG and Eval
What it solves
Easy Dataset は、非構造化かつドメイン固有の文書から大規模言語モデル(LLM)向けの高品質で構造化されたデータセットを作成するという複雑なプロセスをシンプルにします。ファイルの解析、テキストの分割、モデルのファインチューニング、RAG、パフォーマンス評価に必要な質問‑回答ペアの生成といった手作業を不要にします。
How it works
このツールはビジュアルインターフェースを提供し、ユーザーをデータパイプラインへと導きます:PDF、DOCX など様々な文書形式を解析し、インテリジェントなアルゴリズムでテキストを意味のあるチャンクに分割、LLM API を利用して質問、包括的な回答(Chain of Thought を含む)およびドメインラベルツリーを自動生成します。また、データのノイズ除去システムと、ジャッジモデルや人間のブラインドテストによるデータセット品質評価機能も備えています。
Who it’s for
LLM のファインチューニング用データセット構築、RAG のリコール率向上、あるいは垂直ドメインのモデル評価を行いたい、技術者・非技術者問わず利用できるよう設計されています。
Highlights
- Comprehensive Document Support: Handles PDF, Markdown, DOCX, TXT, and EPUB with intelligent recognition.
- Diverse Dataset Types: Supports single-turn QA, multi-turn dialogues, and image-based QA datasets.
- Integrated Evaluation: Features automated scoring via Judge Models and a double-blind "Arena" for human comparison.
- Seamless Integration: One-click configuration for LLaMA Factory and direct upload capabilities to Hugging Face Hub.
- Flexible Model Support: Compatible with any OpenAI-format API, including local models via Ollama.