Goekdeniz-Guelmez/mlx-lm-lora
Train Large Language Models on MLX.
何を解決するか
MLX-LM-LoRAは、Apple Silicon上でローカルに大規模言語モデル(LLM)を微調整するための包括的なツールキットを提供します。Llama、Mistral、Qwen、Gemmaなどのモデルを、さまざまな効率的な学習方法および好み最適化アルゴリズムを使ってカスタマイズ可能で、高価なクラウドGPUインフラの必要性を低減します。
仕組み
このプロジェクトはMLXフレームワークを活用し、Macハードウェアでの学習を最適化しています。LoRA(低ランク適応)、DoRA(重み分解型低ランク適応)、フルプレシジョン学習、および量子化学習(QLoRA)を含む複数の学習タイプをサポートしています。
広範な学習アルゴリズムを実装しています:
- 教師付き微調整(SFT):標準的なインストラクションチューニング。
- 好み最適化:DPO、CPO、ORPO、オンラインDPOを含み、別途報酬モデルを必要とせずに人間の好みにモデルを整合させます。
- 強化学習:GRPO、GSPO、Dr. GRPO、DAPO、RLHF Reinforce、PPOを実装しています。
- 量子化感知学習(QAT):学習中に量子化の影響をシミュレートし、最終的な量子化モデルのパフォーマンスを向上させます。
対象ユーザー
- AI開発者:Apple Silicon上でLLMを実行・微調整したい人。
- MLエンジニア:さまざまな好み最適化およびRLHF技術をローカルで実験したい研究者。
- モデルカスタマイザー:量子化後のモデル品質を維持するために量子化感知学習を統合したいユーザー。
特徴
- Apple Silicon最適化:MLXフレームワークに特化して構築されています。
- 広範なアルゴリズムサポート:基本的なSFTからGRPOやPPOといった高度な技術までカバーしています。
- QAT統合:SFT、DPO、ORPOの学習中に4〜16ビット量子化プロジェクションをサポートしています。
- 柔軟な設定:コマンドラインフラグとYAML設定ファイルの両方をサポートしています。
- カスタム報酬関数:GRPO学習用に、Pythonベースの独自報酬関数を定義できるようにしています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- Dispatch