arcee-ai/mergekit
Tools for merging pretrained large language models.
解決する問題
mergekit は、追加のトレーニングやアンサンブルの高い計算コストを必要とせずに、複数の事前学習済み言語モデルを単一のモデルに結合するために設計されたツールキットです。これにより、ユーザーは専門化されたモデルをマージして多用途なモデルを作成し、モデル間で機能を転送し、推論コストを単一モデルと同じに保ちながらパフォーマンスを最適化できます。
仕組み
このツールは、モデルの重み空間で直接動作します。アウトオブコア方式とテンソルの遅延読み込みを使用するため、CPUや8 GBのVRAMしかないGPUなど、リソースが制約されたハードウェアでも複雑なマージを実行できます。ユーザーはYAML設定ファイルでマージ操作を定義し、マージ方法、使用するモデル、重みや密度などのパラメータを指定します。
対象ユーザー
高価な再トレーニングなしに既存のチェックポイントを組み合わせて、新しい高性能なLLMを作成したいAI研究者や開発者を対象としています。Llama、Mistral、GPT-NeoXなど、幅広いアーキテクチャをサポートしています。
主な特徴
- 多様なマージ方法: Linear、SLERP、TIES、DARE、Arcee Fusionなど、幅広いアルゴリズムをサポート。
- メモリ効率: 遅延読み込みとアウトオブコア処理により、低メモリのハードウェアでもマージが可能。
- 高度なモデル手術: 「フランケンマージ」(レイヤーの断片的な組み立て)や、高密度モデルをMixture of Experts(MoE)にマージする機能を含む。
- 専門ツール: LoRA抽出、トークナイザー移植(
mergekit-tokensurgeon)、多段階マージワークフロー用のユーティリティを提供。 - CUDA/CPUサポート: CPUのみで実行可能、またはGPUで高速化可能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト