hiyouga/LlamaFactory
Unified Efficient Fine-Tuning of 100+ LLMs & VLMs (ACL 2024)
LlamaFactory – 数十種類のLLMをワンクリックでファインチューニング
概要 – LlamaFactoryは、100以上の大規模言語モデル(LLM)をほぼコードを書かずにファインチューニング、評価、および提供できるオープンソースのPythonツールキットです。コマンドラインインターフェースとGradioベースのWeb UI(LlamaBoard)が同梱されており、ローカルまたはクラウド(Colab、SageMaker、AMD/Ascend GPUなど)で実験を実行できます。
重要性 – 最新のLLMをトレーニングまたは適応させるには、通常、分散トレーニング、量子化、オプティマイザのテクニックに関する深い知識が必要です。LlamaFactoryは、最先端の手法(LoRA、QLoRA、FlashAttention-2、GaLore、BAdam、ORPO、DPO、PPO、KTOなど)を多数バンドルし、シンプルなYAML設定で選択できるようにします。その結果、「ゼロコード」のワークフローでありながら、最新の研究にアクセスできます。
コア機能
| カテゴリ | できること |
|---|---|
| モデル対応 | LLaMA-1/2/3/4、LLaVA、Mistral、Mixtral-MoE、Qwen 2/3/2.5-VL、DeepSeek、Gemma 3、GLM-4、Phi-4、InternLM、MiniCPM-o、PaliGemmaなど |
| トレーニングパラダイム | 全パラメータ、フリーズチューニング、8ビット/4ビット/2ビットQLoRA、LoRA+、LongLoRA、DoRA、ブロック拡張、継続事前トレーニング、教師ありファインチューニング、マルチモーダル(画像/動画/音声)ファインチューニング、報酬モデリング、PPO/DPO/ORPO/KTO、EasyR1による強化学習 |
| オプティマイザとテクニック | GaLore、BAdam、APOLLO、Adam-mini、Muon、OFT/OFTv2、NEFTune、rsLoRA、RoPEスケーリング、FlashAttention-2、Unsloth、Liger-Kernel、KTransformers、SGLang/vLLM推論バックエンド |
| ハードウェアサポート | NVIDIA GPU、AMD ROCm、Ascend NPU、Intel Gaudi、SageMaker HyperPod、Dockerコンテナ、Colabノートブック |
| モニタリング | TensorBoard、Weights & Biases、MLflow、SwanLab、組み込みLlamaBoard UI |
| デプロイメント | OpenAI互換REST API、Gradio UI、高スループットサービング用のvLLMまたはSGLangワーカー |
| データ処理 | 組み込みデータセットローダー、データ中心パイプライン(DataFlow、DataFlex)、汚染を避けるための自動パッキング |
典型的なワークフロー(クイックスタート)
- インストール –
pip install llamafactoryまたはDockerイメージhiyouga/llamafactoryをプルします。 - データ準備 – トレーニングセットをフォルダに配置するか、提供されている例(ツール使用用の
glaive_toolcall_enなど)を使用します。LlamaFactoryはModelScope/Modelers Hubからもダウンロードできます。 - 設定作成 – 短いYAMLファイルで、モデル、データセット、チューニング方法(例:
lora)、量子化ビット数、特別なテクニック(use_unsloth: true)を選択します。 - 実行 –
llamafactory train path/to/config.yaml(CLI)またはllamafactory guiでGUIを起動し、数回のクリックでジョブを開始します。 - 追跡 – メトリクスがLlamaBoardに表示されます。オプションでログをWandB/MLflow/SwanLabにプッシュします。
- 提供 – トレーニング後、
llamafactory serve path/to/ckpt.yamlを実行して、OpenAIスタイルのエンドポイントまたはGradioチャットインターフェースを公開します。
誰が使うべきか?
- 研究者 – ボイラープレートのトレーニングループを書かずに、新しいファインチューニングレシピをプロトタイプする必要がある人。
- プロダクトチーム – 公開LLM(例:Llama 3、Qwen 3)をドメイン固有のコーパスに迅速に適応させたいチーム。
- 教育者と学生 – RL-HF、選好学習、マルチモーダルLLMのラボ用にすぐ使える環境を探している人。
- 運用エンジニア – クラウドGPU、SageMaker、またはオンプレミスのNPUクラスターで実行できる、コンテナ化された再現可能なパイプラインを好む人。
インストールとデプロイメントオプション
- Pip –
pip install llamafactory(llamafactoryCLIが追加されます)。 - Docker –
docker pull hiyouga/llamafactoryを実行し、GPUデバイスをマウントして実行します。 - Colab / DSW – READMEにリンクされているすぐ使えるノートブックで、無料枠の実験が可能です。
- vLLM / SGLang – サービング設定で
infer_backend: vllm(またはsglang)を設定すると、推論が最大2〜3倍高速になります。
コミュニティとエコシステム
- スターとアクティビティ – >1k GitHubスター、CIテスト、頻繁なリリース。
- 業界での採用 – Amazon、NVIDIA、Alibaba Cloudで本番ファインチューニングに使用されています。
- サポートチャネル – Discord、WeChatグループ、公式ブログ、増え続けるチュートリアル。
- 引用 – 学術的なクレジットのために、論文 「LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models」(arXiv)が提供されています。
TL;DR
LlamaFactoryは、さまざまなハードウェアバックエンドで多種多様なLLMをファインチューニングするための、包括的でゼロコードのプラットフォームです。最新のトレーニングテクニックをバンドルし、CLIと使いやすいGUIの両方を提供し、実験追跡をサポートし、結果のモデルを提供するためのOpenAI互換APIを即座に立ち上げることができます。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト