FastFlowLM/FastFlowLM

Run LLMs on AMD Ryzen™ AI NPUs in minutes. Just like Ollama - but purpose-built and deeply optimized for the AMD NPUs.

解決する課題

FastFlowLM(FLM)を使用すると、ユーザーは AMD Ryzen™ AI NPU 上で大規模言語モデル(LLM)やビジョン‑ラングエッジモデル(VLM)をローカルで実行でき、GPU や CPU の負荷を必要としません。GPU ベースの推論に代わる省電力で軽量な代替手段を提供し、最大 256k トークンのコンテキスト長をサポートします。

仕組み

FLM は NPU‑first ランタイムとして、AMD の XDNA2 NPU アーキテクチャ(Strix、Strix Halo、Kraken、Gorgon Point チップをサポート)向けにモデルカーネルを最適化します。ターミナルで直接モデルを実行できる CLI と、REST および OpenAI 互換 API を提供するローカルサーバーモードを備えており、他のアプリケーションへの統合が容易です。

対象者

AMD Ryzen™ AI シリーズチップを搭載した開発者やユーザーで、重い GPU リソースに依存せず、プライベートかつ効率的にローカル AI モデルを実行したい方。

ハイライト

  • NPU 最適化:AMD Ryzen™ AI NPU だけで実行し、消費電力を削減し GPU/CPU を解放。
  • 超軽量:ランタイムはわずか 17 MB、インストールは 20 秒未満で完了。
  • 開発者フレンドリー:Ollama に似た CLI と API を提供し、モデルのデプロイや切り替えが簡単。
  • 幅広いモデル対応:ビジョン、オーディオ、埋め込み、MoE モデルをサポート。
  • 高容量:最大 256k トークンのコンテキストウィンドウに対応。