TurboFieldfare: M 시리즈 맥에서 2GB RAM으로 Gemma 4 26B 실행
TurboFieldfare는 활성 메모리 사용량을 약 2GB로 줄여 Apple Silicon Mac, 특히 기본 모델인 8GB RAM만 탑재된 모델에서도 Gemma 4 26B-A4B 모델을 실행할 수 있게 합니다. 이는 공유 코어와 KV 캐시만 메모리에 유지하고, 필요한 MoE(전문가 혼합) 가중치를 SSD에서 실시간으로 스트리밍함으로써 달성됩니다.
SSD 기반 전문가 스트리밍 아키텍처
TurboFieldfare는 라우팅된 전문가에 대한 맞춤형 스트리밍 메커니즘을 구현함으로써 전체 14.3GB 모델을 RAM에 로드할 필요를 없앱니다.
메모리 관리 및 I/O
각 트랜스포머 레이어에서 엔진은 상주 가중치를 사용해 어텐션과 라우터를 계산합니다. CPU는 라우터의 상위 8개 전문가 ID를 사용해 16슬롯 LFU(Least Frequently Used) 캐시를 계획합니다. 필요한 전문가가 캐시에 없을 경우, 엔진은 제한된 병렬 pread 호출을 수행해 Metal이 접근 가능한 버퍼에 로드합니다. 효율성을 극대화하기 위해 Metal은 SSD 읽기가 진행되는 동안 상주 공유 전문가 브랜치를 동시에 계산합니다.
가중치 양자화 및 레이아웃
메모리 사용량을 더욱 최소화하기 위해 엔진은 다음과 같은 특정 양자화 형식을 사용합니다:
- Weights: 임베딩, 어텐션, 공유 전문가, 라우팅된 전문가에 대해 MLX affine 4-bit (group 64) 사용.
- Router: 8-bit 양자화.
- KV Cache: 25 레이어에 슬라이딩 윈도우 방식을, 5개의 전체 어텐션 레이어에 선형 저장 방식을 적용한 FP16 저장.
성능 벤치마크
처리량은 하드웨어 세대와 사용 가능한 시스템 RAM에 따라 크게 달라지며, 이는 OS 페이지 캐시가 전문가를 상주시킬 수 있는 능력에 영향을 줍니다.
| 하드웨어 | 측정된 디코드 속도 |
|---|---|
| M2 MacBook Air (8 GB RAM) | 5.1–6.3 tok/s |
| M4 Mac mini (16 GB RAM) | ≅5 tok/s |
| M5 Pro (24 GB RAM) | 31–35 tok/s |
| M4 Max (64 GB RAM) | ≅48 tok/s |
RAM이 더 큰 사용자(예: 64GB)는 OS 페이지 캐시가 전체 12GB packed_experts 세트를 메모리에 상주시킬 수 있어 SSD 지연을 사실상 없애기 때문에 훨씬 높은 속도를 보고합니다.
구현 및 도구
TurboFieldfare는 llama.cpp나 MLX와 같은 일반 프레임워크의 래퍼가 아니라 Swift 6.2와 Metal 4로 작성된 모델 전용 런타임입니다. 여러 인터페이스를 제공하여 상호작용할 수 있습니다:
- Native Mac App: 모델 설치와 채팅을 위한 SwiftUI/AppKit 애플리케이션.
- CLI: 명령줄 인터페이스로 지시문 채팅 및 원시 완성을 수행합니다.
- OpenAI-Compatible Server: Chat Completions와 함수 도구를 지원하는 루프백 서버.
- Streaming Installer: Hugging Face 체크포인트를 범위 요청을 통해 직접
.gturbo형식으로 재패키징하는 도구로, 전체 소스 체크포인트를 디스크에 저장할 필요가 없습니다.
기술 요구 사항
TurboFieldfare를 실행하려면 다음 환경이 필요합니다:
- Hardware: Apple Silicon Mac (arm64).
- OS: macOS 26 with Metal 4.
- Development Tools: Xcode 26 and Swift 6.2 or newer.
- Storage: 모델 설치를 위해 약 14.3 GB의 여유 공간이 필요합니다.
커뮤니티 인사이트 및 분석
사용자들 간의 기술 토론은 LLM에 대한 SSD 스트리밍의 실현 가능성에 대해 몇 가지 핵심 포인트를 강조합니다:
- Comparison to mmap:
llama.cpp가mmap을 통해 낮은 RAM에서 대형 모델을 실행할 수 있는 반면, TurboFieldfare는 SSD 읽기를 추론 활동과 구체적으로 동기화하여 지연 시간을 최소화합니다. - SSD Wear: 지속적인 가중치 읽기가 SSD 수명에 미치는 영향에 대해 사용자들이 질문했지만, 소스에서는 구체적인 열화 데이터가 제공되지 않았습니다.
- Hardware Evolution: M2에서 M5로의 성능 향상은 메모리 대역폭 증가와 더 빠른 SSD가 대형 모델의 로컬 추론을 점점 실용적으로 만들고 있음을 시사합니다.
"2GB에 26B를 실행한다는 것은 전체 아파트를 보관함에 넣고도 여전히 움직일 공간이 남는 것과 같은 엔지니어링적 비유입니다."