FastFlowLM/FastFlowLM

Run LLMs on AMD Ryzen™ AI NPUs in minutes. Just like Ollama - but purpose-built and deeply optimized for the AMD NPUs.

它解决了什么

FastFlowLM(FLM)允许用户在 AMD Ryzen™ AI NPU 上本地运行大型语言模型(LLM)和视觉语言模型(VLM),无需 GPU 或额外的 CPU 负载。它提供一种节能、轻量的 GPU 替代推理方案,支持最长 256k token 的上下文长度。

它如何工作

FLM 作为 NPU‑first 运行时,针对 AMD 的 XDNA2 NPU 架构(支持 Strix、Strix Halo、Kraken 和 Gorgon Point 芯片)优化模型内核。它提供 CLI 可直接在终端运行模型,也有本地服务器模式,提供 REST 和兼容 OpenAI 的 API,便于集成到其他应用中。

适用人群

拥有 AMD Ryzen™ AI 系列芯片的开发者和用户,想要在本地私密且高效地运行 AI 模型,而不依赖大型 GPU 资源。

亮点

  • NPU 优化:完全在 AMD Ryzen™ AI NPU 上运行,降低功耗并释放 GPU/CPU 资源。
  • 超轻量:运行时仅 17 MB,安装时间不足 20 秒。
  • 开发者友好:提供类似 Ollama 的 CLI 与 API,轻松部署和切换模型。
  • 广泛模型支持:支持视觉、音频、嵌入和 MoE 模型。
  • 高容量:支持最高 256k token 的上下文窗口。