llmfit: 一个感知硬件的模型推荐器,可将 LLM 与您的系统 RAM 和 GPU 进行匹配
llmfit: 一个感知硬件的模型推荐器,可将 LLM 与您的系统 RAM 和 GPU 进行匹配
它解决了什么问题
它解决了选择与用户特定硬件兼容的大语言模型 (LLM) 的困难。用户不再需要猜测模型是否能放入 VRAM 或以可接受的速度运行,而是可以找到适合其可用 RAM、CPU 和 GPU 的合适尺寸的模型。
工作原理
llmfit 检测系统的硬件规格,并从四个关键维度对数百个模型目录进行评分:内存适配度、预估速度、质量和上下文。速度预估是基于运行时采样和社区贡献的测量值,通过内存带宽模型推导出来的。该工具提供了一个交互式的 TUI (Terminal User Interface) 和用于自动化的 CLI,支持各种本地运行时提供商,如 Ollama、llama.cpp、MLX 和 LM Studio。
适用人群
它专为运行本地 LLM 的开发者和 AI 爱好者设计,旨在帮助他们根据实际硬件限制优化模型选择,而无需进行手动计算。
亮点
- 硬件检测:自动识别 RAM、CPU 和 GPU/VRAM 以确定模型兼容性。
- 多后端支持:兼容包括 Ollama、llama.cpp、MLX、Docker Model Runner 和 LM Studio 在内的本地提供商。
- 社区基准测试:允许用户在自己的硬件上测量真实的每秒 token 数,并将结果贡献回项目,以改进他人的预估值。
- 灵活的界面:既提供用于探索的视觉化 TUI,也提供用于集成到脚本或智能体 (agents) 中的 JSON 输出 CLI。
- 架构感知:支持复杂的模型类型,包括 Mixture-of-Experts (MoE) 架构。
Sources
- undefinedAlexsJones/llmfit