FastFlowLM/FastFlowLM
Run LLMs on AMD Ryzen™ AI NPUs in minutes. Just like Ollama - but purpose-built and deeply optimized for the AMD NPUs.
解決する課題
FastFlowLM(FLM)を使用すると、ユーザーは AMD Ryzen™ AI NPU 上で大規模言語モデル(LLM)やビジョン‑ラングエッジモデル(VLM)をローカルで実行でき、GPU や CPU の負荷を必要としません。GPU ベースの推論に代わる省電力で軽量な代替手段を提供し、最大 256k トークンのコンテキスト長をサポートします。
仕組み
FLM は NPU‑first ランタイムとして、AMD の XDNA2 NPU アーキテクチャ(Strix、Strix Halo、Kraken、Gorgon Point チップをサポート)向けにモデルカーネルを最適化します。ターミナルで直接モデルを実行できる CLI と、REST および OpenAI 互換 API を提供するローカルサーバーモードを備えており、他のアプリケーションへの統合が容易です。
対象者
AMD Ryzen™ AI シリーズチップを搭載した開発者やユーザーで、重い GPU リソースに依存せず、プライベートかつ効率的にローカル AI モデルを実行したい方。
ハイライト
- NPU 最適化:AMD Ryzen™ AI NPU だけで実行し、消費電力を削減し GPU/CPU を解放。
- 超軽量:ランタイムはわずか 17 MB、インストールは 20 秒未満で完了。
- 開発者フレンドリー:Ollama に似た CLI と API を提供し、モデルのデプロイや切り替えが簡単。
- 幅広いモデル対応:ビジョン、オーディオ、埋め込み、MoE モデルをサポート。
- 高容量:最大 256k トークンのコンテキストウィンドウに対応。