FlashML-org/FreeToken
FreeToken brings datacenter-scale model serving to your desktop. Run massive models locally, fast and efficiently.
해결하는 문제
FreeToken은 게이밍 PC와 노트북과 같은 소비자급 하드웨어에서 최대 290B 이상의 파라미터를 가진 대규모 Mixture-of-Experts (MoE) 모델을 인터랙티브 속도로 실행할 수 있도록 설계되었습니다. GPU, CPU, 호스트 메모리를 통합적이고 유연한 플랫폼으로 간주함으로써 에지 디바이스의 메모리 및 대역폭 제약을 극복합니다.
작동 방식
엔진은 여러 최적화 기술을 사용하여 하드웨어 효율을 극대화합니다:
- 대역폭 적응 실행: CPU-GPU 동시 실행을 위한 $q^\star$ 정책을 통해 데이터 이동을 최적화합니다.
- 전문가 캐시: 글로벌 LRU(최근 사용되지 않은) 전문가 캐시와 FTW 빠른 가중치 형식을 사용하여 모델 가중치 접근 속도를 향상시킵니다.
- 의미 인식 캐시: KV 캐시와 반복 상태에 의미 기반 앵커 체크포인트를 사용하여 에이전트 컨텍스트 편집(도구 호출 등) 시 중복 재계산을 방지합니다.
- 유연한 메모리: 런타임 중에 VRAM을 전문가 캐시와 KV 메모리 간에 동적으로 재할당할 수 있으며, 재시작이 필요 없습니다.
- 양자화 지원: MXFP4, NVFP4, FP8, BF16 등 다양한 형식을 지원하여 메모리 사용량을 줄입니다.
대상 사용자
클라우드 인프라에 의존하지 않고 NVIDIA RTX 30, 40, 50 시리즈 GPU를 탑재한 소비자 장비에서 최첨단 규모의 오픈웨이트 MoE 모델을 로컬에서 실행하고자 하는 개발자 및 AI 애호가입니다.
주요 특징
- 에지 네이티브 런타임: 소비자 하드웨어에 최적화되어 있으며, 더블 버퍼링된 프리필 스트리밍과 그래프 호환 실행을 지원합니다.
- 광범위한 모델 지원: DeepSeek-V4-Flash, Qwen3.6-35B-A3B, GLM-5.2 등과 호환됩니다.
- API 호환성: Anthropic 및 OpenAI 호환 API를 제공하여 Claude Code, DeepSeek Harness와 같은 코드 에이전트와의 통합이 간편합니다.
- 크로스 플랫폼: Windows 및 Linux용 데스크톱 앱 또는 CLI로 제공됩니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트