ml-explore/mlx-lm
Run LLMs with MLX
解决的问题
mlx-lm 旨在简化在 Apple silicon 上运行、微调和量化大型语言模型(LLMs)的过程。它通过提供统一的 Python 包和命令行工具,消除了在 Mac 硬件上本地部署 LLM 的障碍,支持文本生成和模型优化。
如何工作
该项目利用 MLX 框架优化 Apple silicon 上的 LLM 性能。它提供 Python API 和 CLI,用于从 Hugging Face Hub 加载模型、生成文本以及管理模型权重。主要技术特性包括:
- 模型转换与量化:可将模型转换并量化(例如转为 4 位)以减少内存占用,并重新上传至 Hugging Face Hub。
- 内存管理:使用旋转式固定大小的键值(KV)缓存和可配置的预填充步长,高效处理长提示。
- 提示缓存:允许用户缓存长提示,避免在多次查询中重复计算。
- 微调:支持低秩(LoRA)和全模型微调,包括对量化模型的支持。
- 分布式计算:通过
mx.distributed实现分布式推理和微调。
适用人群
使用 Apple silicon Mac 的开发者和研究人员,希望在本地运行 LLM、针对硬件进行优化,或为特定任务进行微调。
主要亮点
- Hugging Face 集成:与 Hugging Face Hub 直接集成,便于模型访问和上传。
- Apple silicon 优化:专为 Mac 硬件优化,支持 macOS 15+ 下大模型的内存连接。
- 本地聊天 REPL:内置聊天界面,可立即与模型交互。
- 高效处理长上下文:通过提示缓存和旋转 KV 缓存等工具,实现长文本生成的可扩展性。
相关
- 项目
- 项目
- 项目
- 项目
- 项目