ztxz16/fastllm
fastllm是后端无依赖的高性能大模型推理库。同时支持张量并行推理稠密模型和混合模式推理MOE模型,任意10G以上显卡即可推理满血DeepSeek。双路9004/9005服务器+单显卡部署DeepSeek满血满精度原版模型,单并发20tps;INT4量化模型单并发30tps,多并发可达60+。
해결하는 문제
fastllm은 VRAM이 제한된 하드웨어에서 대규모 모델(예: DeepSeek R1 671B)을 실행할 수 있도록 설계된 고성능 LLM 추론 라이브러리입니다. PyTorch에 의존하지 않고 고유의 C++ 연산자를 사용함으로써, 다양한 GPU와 CPU(구형 하드웨어 및 전용 NPU 포함)에서 효율적인 실행이 가능합니다.
작동 방식
이 라이브러리는 자체적인 저수준 연산자를 C++로 구현하고, 다음과 같은 최적화 기술을 지원합니다:
- 하이브리드 추론: GPU와 CPU(또는 여러 NUMA 노드) 간에 모델 실행을 분할할 수 있어, MoE(전문가의 혼합) 레이어를 CPU로 오프로드함으로써 단일 GPU에서 대규모 MoE 모델을 배포할 수 있습니다.
- 유연한 양자화: FP8, INT8, INT4, AWQ 형식을 지원하며, 온라인 양자화 또는 특정 형식으로 모델을 내보내어 더 빠른 로딩이 가능합니다.
- 텐서 병렬: 복수 GPU에서 텐서 병렬 추론을 지원하며, 3, 5, 7과 같은 홀수 카드에도 대응합니다.
- 광범위한 하드웨어 지원: NVIDIA(M40부터 5090), AMD(MI50, 7900), 그리고 다양한 중국산 NPU(Tianshu, Muxi, Ascend)와 호환됩니다.
대상 사용자
- 소비자용 또는 구형 하드웨어에서 대규모 모델을 실행하고 싶은 개발자 및 연구자.
- Linux, Windows, Android에서 가벼우면서도 PyTorch에 의존하지 않는 추론 엔진이 필요한 사용자.
- LLM 서버, WebUI, 로컬 채팅을 쉽게 시작할 수 있는 CLI 도구를 찾는 사람.
주요 특징
- 낮은 VRAM 요구사항: VRAM > 10GB인 경우 CPU 오프로드를 통해 단일 카드에서 전체 DeepSeek R1 671B 모델을 실행 가능.
- PyTorch에 의존하지 않음: 고유의 C++ 구현으로 성능 향상과 이식성 향상.
- 다양한 양자화: 모든 GPU에서 FP8 추론을 지원하며, 동적 양자화도 가능.
- 다양한 배포 옵션: OpenAI 호환 API 서버, WebUI, TUI 배포 워크숍 포함.
- 크로스플랫폼: NVIDIA, AMD, 다양한 NPU를 지원하며, Android용 컴파일도 가능.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트