localai-org/apex-quant
Adaptive Precision for EXpert Models: MoE-aware mixed-precision quantization
What it solves
APEXは、Mixture-of-Experts (MoE) モデルにおける一律の量子化の非効率性を解決します。標準的な量子化は、多くの場合すべての重みを等しく扱うため、モデルサイズが過大になったり、不必要な精度低下を招いたりします。APEXは、精度を犠牲にすることなくモデルサイズを削減し、推論速度を向上させることで、大規模なMoEモデルをフル精度モデルの品質を維持または上回る状態で、コンシューマー向けハードウェア(16GB VRAMのGPUなど)で実行できるようにします。
How it works
APEXは、MoEモデルの構造的特性に合わせて特別に設計された混合精度戦略を使用します:
- Tensor Classification: 重みを、ルーティングされるエキスパート(スパースであり、より圧縮可能)、共有エキスパート(重要であり、高精度が必要)、およびattention/SSMの重みに分類します。
- Layer-wise Precision Gradient: ノイズに対してより敏感な「エッジ」レイヤー(最初と最後の数レイヤー)には高い精度を割り当て、冗長な中間レイヤーには低い精度を割り当てます。
- Diverse Calibration: 「I-variants」は、Wikipediaだけでなく、チャット、コード、推論をカバーするキャリブレーションデータセットを使用することで、実世界のタスクにおけるパフォーマンスを向上させます。
- llama.cpp Integration: 標準の llama.cpp における
--tensor-type-fileと--tensor-typeフラグを活用し、カスタムコードの変更を必要とせずに、これらの特定の精度割り当てを適用します。
Who it’s for
大規模なMoEモデルを限られたハードウェアにデプロイしたい開発者やAI研究者、特にGGUF形式と llama.cpp エコシステムを使用している人々です。
Highlights
- High Efficiency: Q8_0 のパープレキシティを半分のサイズで実現し、Unsloth Dynamic 量子化よりも速度とサイズの両面で優れています。
- Five Precision Tiers: 「I-Quality」 (最大精度) から 「Mini」 (16GB VRAM で実行可能な最小サイズ) までの構成を提供します。
- Lossless Compression: 一部の指標ではフル Q8_0 の品質に匹敵、またはそれを上回りますが、サイズは大幅に小さくなります。
- Hardware Accessible: RTX 4060 Ti 16GB のようなコンシューマー向け GPU で 35B MoE モデルを実行することを可能にします。
- Zero Code Changes: 標準の llama.cpp と LocalAI で動作します。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- Dispatch