FastFlowLM/FastFlowLM
Run LLMs on AMD Ryzen™ AI NPUs in minutes. Just like Ollama - but purpose-built and deeply optimized for the AMD NPUs.
它解决了什么
FastFlowLM(FLM)允许用户在 AMD Ryzen™ AI NPU 上本地运行大型语言模型(LLM)和视觉语言模型(VLM),无需 GPU 或额外的 CPU 负载。它提供一种节能、轻量的 GPU 替代推理方案,支持最长 256k token 的上下文长度。
它如何工作
FLM 作为 NPU‑first 运行时,针对 AMD 的 XDNA2 NPU 架构(支持 Strix、Strix Halo、Kraken 和 Gorgon Point 芯片)优化模型内核。它提供 CLI 可直接在终端运行模型,也有本地服务器模式,提供 REST 和兼容 OpenAI 的 API,便于集成到其他应用中。
适用人群
拥有 AMD Ryzen™ AI 系列芯片的开发者和用户,想要在本地私密且高效地运行 AI 模型,而不依赖大型 GPU 资源。
亮点
- NPU 优化:完全在 AMD Ryzen™ AI NPU 上运行,降低功耗并释放 GPU/CPU 资源。
- 超轻量:运行时仅 17 MB,安装时间不足 20 秒。
- 开发者友好:提供类似 Ollama 的 CLI 与 API,轻松部署和切换模型。
- 广泛模型支持:支持视觉、音频、嵌入和 MoE 模型。
- 高容量:支持最高 256k token 的上下文窗口。