Epistates/pmetal
PMetal: high-performance Apple Silicon framework for local LLM inference, LoRA/QLoRA fine-tuning, serving, quantization, and MLX/Metal acceleration.
解决的问题
PMetal 是专为 Apple Silicon 设计的完整机器学习平台。它无需离开 Apple 生态系统即可完成高性能 ML 任务,通过利用低级 Metal GPU 内核和 Apple Neural Engine (ANE),提供统一的模型训练、微调和推理工具套件。
工作原理
PMetal 使用 Rust 编写,作为可嵌入的 SDK 和一组工具运行。它与 MLX C++ 桥接和自定义 Metal 内核集成,以在 M 系列芯片上实现最佳性能。平台通过三种主要接口访问:
- 桌面 GUI:基于 Tauri 和 Svelte 的可视化模型管理与训练应用程序。
- 终端 TUI:20 个标签页的控制中心,用于深度配置和监控。
- CLI:用于快速执行训练、推理和量化任务的命令行界面。
它还支持通过 Thunderbolt、以太网或 Wi-Fi 在多台 Mac 上构建“家庭集群”进行分布式训练,并自动形成环形结构以执行梯度 all-reduce 操作。
适用人群
- 希望在 Apple 硬件上训练和微调模型的 ML 工程师和研究人员。
- 希望通过提供的 SDK 将高性能 ML 能力集成到自己应用中的 Rust 和 Python 开发者。
- 希望使用 GUI 或 TUI 管理本地 LLM、量化和模型合并的 Apple Silicon 用户。
主要亮点
- 全栈工具链:涵盖 ML 生命周期的每个阶段(预训练、SFT、LoRA、QLoRA、蒸馏和推理)的 GUI、TUI 和 CLI。
- 硬件优化:自动检测芯片系列(M1 至 M5),并根据设备等级(Base、Pro、Max、Ultra)调整内核参数。
- 分布式训练:支持 Thunderbolt 感知的集群,实现多 Mac 分布式训练,并具备自动网络回退功能。
- 广泛模型支持:支持 Llama、Qwen、DeepSeek、Mistral、Gemma 和 Phi 等多种架构。
- 高级技术:实现 GRPO 推理训练、知识蒸馏、推测解码(DFlash)以及多种模型合并策略(SLERP、TIES、DARE)。
相关
- 项目
- 项目
- 项目
- Dispatch
- 项目