llmfit: システムの RAM と GPU に LLM を適合させる、ハードウェアを意識したモデルレコメンダー

llmfit: システムの RAM と GPU に LLM を適合させる、ハードウェアを意識したモデルレコメンダー

解決する課題

ユーザーの特定のハードウェアと互換性のある大規模言語モデル (LLM) を選択する際の難しさを解決します。モデルが VRAM に収まるか、あるいは許容可能な速度で動作するかを推測する代わりに、ユーザーは利用可能な RAM、CPU、および GPU に最適なサイズのモデルを見つけることができます。

仕組み

llmfit はシステムのハードウェア仕様を検出し、数百ものモデルのカタログを「メモリ適合性」、「推定速度」、「品質」、「コンテキスト」の 4 つの主要な次元でスコアリングします。速度の推定値は、実行時のサンプリングとコミュニティから提供された測定値に基づくメモリ帯域幅モデルから導出されます。このツールは、対話的な TUI (Terminal User Interface) と自動化用の CLI を提供し、Ollama、llama.cpp、MLX、および LM Studio のような様々なローカル実行環境プロバイダーをサポートしています。

対象ユーザー

手動での計算を行うことなく、実際のハードウェア制約に基づいてモデル選択を最適化したい、ローカル LLM を実行している開発者や AI エンジニア向けに設計されています。

ハイライト

  • ハードウェア検出: RAM、CPU、および GPU/VRAM を自動的に識別し、モデルの互換性を判断します。
  • マルチバックエンド対応: Ollama、llama.cpp、MLX、Docker Model Runner、および LM Studio を含むローカルプロバイダーと互換性があります。
  • コミュニティ・ベンチマーキング: ユーザーが自身のハードウェア上で実際の tokens-per-second を測定し、その結果をプロジェクトにフィードバックすることで、他のユーザーの推定精度を向上させることができます。
  • 柔軟なインターフェース: 探索用の視覚的な TUI と、スクリプトやエージェントへの統合用の JSON 出力 CLI の両方を提供します。
  • アーキテクチャ対応: Mixture-of-Experts (MoE) アーキテクチャを含む複雑なモデルタイプをサポートしています。

Sources