FastFlowLM/FastFlowLM

Run LLMs on AMD Ryzen™ AI NPUs in minutes. Just like Ollama - but purpose-built and deeply optimized for the AMD NPUs.

它解決了什麼

FastFlowLM(FLM)讓使用者能在 AMD Ryzen™ AI NPU 上本機執行大型語言模型(LLM)與視覺語言模型(VLM),不需要 GPU 或額外的 CPU 負載。它提供一個節能、輕量的 GPU 以外推論方案,支援最高 256k token 的上下文長度。

它如何運作

FLM 作為 NPU‑first 執行環境,針對 AMD 的 XDNA2 NPU 架構(支援 Strix、Strix Halo、Kraken 與 Gorgon Point 晶片)優化模型核心。它提供 CLI 可直接在終端機執行模型,亦有本機伺服器模式,提供 REST 與相容 OpenAI 的 API,方便整合至其他應用程式。

目標對象

擁有 AMD Ryzen™ AI 系列晶片的開發者與使用者,想要在本機私密且高效地執行 AI 模型,且不依賴大型 GPU 資源。

重點特色

  • NPU 優化:完整在 AMD Ryzen™ AI NPU 上執行,降低功耗並釋放 GPU/CPU 資源。
  • 超輕量:執行環境僅 17 MB,安裝時間不足 20 秒。
  • 開發者友好:提供類似 Ollama 的 CLI 與 API,讓部署與切換模型變得簡單。
  • 廣泛模型支援:支援視覺、音訊、嵌入與 MoE 模型。
  • 高容量:支援最高 256k token 的上下文視窗。