llmfit: 一款根據系統 RAM 與 GPU 進行匹配的硬體感知型模型推薦工具

llmfit: 一款根據系統 RAM 與 GPU 進行匹配的硬體感知型模型推薦工具

它解決了什麼問題

它解決了選擇與使用者特定硬體相容的大型語言模型 (LLM) 的困難。使用者不再需要猜測模型是否能放入 VRAM 或以可接受的速度運行,而是可以找到適合其可用 RAM、CPU 與 GPU 的模型。

運作原理

llmfit 會偵測系統的硬體規格,並從記憶體適配性、預估速度、品質與上下文長度四個關鍵維度,對數百個模型進行評分。速度預估是基於執行時採樣與社群貢獻的測量數據,透過記憶體頻寬模型推導而來。此工具提供互動式 TUI (Terminal User Interface) 與用於自動化的 CLI,支援多種本地執行環境提供者,例如 Ollama、llama.cpp、MLX 與 LM Studio。

對象是誰

它是為想要在不進行手動計算的情況下,根據實際硬體限制來優化模型選擇的本地 LLM 執行開發者與 AI 愛好者所設計。

重點功能

  • 硬體偵測:自動識別 RAM、CPU 與 GPU/VRAM 以確定模型相容性。
  • 多後端支援:相容於包含 Ollama、llama.cpp、MLX、Docker Model Runner 與 LM Studio 在內的本地提供者。
  • 社群基準測試:允許使用者在自己的硬體上測量真實的 tokens-per-second 並將結果回饋給專案,以改善他人的預估值。
  • 彈性介面:提供用於探索的視覺化 TUI 以及用於整合至腳本或代理程式的 JSON-output CLI。
  • 架構感知:支援複雜的模型類型,包括 Mixture-of-Experts (MoE) 架構。

Sources