FastFlowLM/FastFlowLM
Run LLMs on AMD Ryzen™ AI NPUs in minutes. Just like Ollama - but purpose-built and deeply optimized for the AMD NPUs.
해결하는 문제
FastFlowLM(FLM)을 사용하면 사용자가 AMD Ryzen™ AI NPU에서 대형 언어 모델(LLM) 및 비전‑언어 모델(VLM)을 로컬에서 실행할 수 있으며, GPU나 추가 CPU 부하가 필요하지 않습니다. GPU 기반 추론에 대한 전력 효율적이고 가벼운 대안을 제공하며, 최대 256k 토큰의 컨텍스트 길이를 지원합니다.
작동 방식
FLM은 NPU‑first 런타임으로, AMD의 XDNA2 NPU 아키텍처( Strix, Strix Halo, Kraken, Gorgon Point 칩 지원)를 위해 모델 커널을 최적화합니다. 터미널에서 직접 모델을 실행할 수 있는 CLI와 REST 및 OpenAI 호환 API를 제공하는 로컬 서버 모드를 제공하여 다른 애플리케이션과의 통합을 용이하게 합니다.
대상 사용자
AMD Ryzen™ AI 시리즈 칩을 보유한 개발자 및 사용자를 대상으로 하며, 무거운 GPU 리소스에 의존하지 않고 로컬에서 AI 모델을 사적으로 효율적으로 실행하고자 하는 분들을 위한 솔루션입니다.
주요 특징
- NPU 최적화: AMD Ryzen™ AI NPU에서 완전 실행되어 전력 소비를 줄이고 GPU/CPU를 해방합니다.
- 초경량: 런타임 크기는 17 MB에 불과하며 설치 시간은 20초 미만입니다.
- 개발자 친화적: Ollama와 유사한 CLI와 API를 제공해 모델 배포 및 전환이 쉽습니다.
- 광범위한 모델 지원: 비전, 오디오, 임베딩, MoE 모델을 지원합니다.
- 고용량: 최대 256k 토큰의 컨텍스트 윈도우를 지원합니다.