llmfit: 사용자의 시스템 RAM 및 GPU에 맞춰 LLM을 매칭하는 하드웨어 인식형 모델 추천 도구

llmfit: 사용자의 시스템 RAM 및 GPU에 맞춰 LLM을 매칭하는 하드웨어 인식형 모델 추천 도구

해결하는 문제

사용자의 특정 하드웨어와 호환되는 대규모 언어 모델(LLM)을 선택하는 데 따르는 어려움을 해결합니다. 모델이 VRAM에 들어갈지 또는 수용 가능한 속도로 실행될지 추측하는 대신, 사용자는 사용 가능한 RAM, CPU 및 GPU에 적합한 크기의 모델을 찾을 수 있습니다.

작동 방식

llmfit은 시스템의 하드웨어 사양을 감지하고 수백 개의 모델 카탈로그를 네 가지 핵심 차원인 메모리 적합성, 예상 속도, 품질, 그리고 컨텍스트를 기준으로 점수를 매깁니다. 속도 추정치는 런타임 샘플링과 커뮤니티 기여 측정값을 기반으로 한 메모리 대역폭 모델에서 도출됩니다. 이 도구는 대화형 TUI(Terminal User Interface)와 자동화를 위한 CLI를 제공하며, Ollama, llama.cpp, MLX, LM Studio와 같은 다양한 로컬 런타임 제공업체를 지원합니다.

대상 사용자

수동 계산 없이 실제 하드웨어 제약 조건에 따라 모델 선택을 최적화하고자 하는 로컬 LLM 실행 개발자 및 AI 애호가들을 위해 설계되었습니다.

주요 특징

  • 하드웨어 감지: RAM, CPU 및 GPU/VRAM을 자동으로 식별하여 모델 호환성을 결정합니다.
  • 멀티 백엔드 지원: Ollama, llama.cpp, MLX, Docker Model Runner, LM Studio를 포함한 로컬 제공업체를 지원합니다.
  • 커뮤니티 벤치마킹: 사용자가 자신의 하드웨어에서 실제 초당 토큰 수(tokens-per-second)를 측정하고 그 결과를 프로젝트에 다시 기여하여 다른 사용자를 위한 추정치를 개선할 수 있도록 합니다.
  • 유연한 인터페이스: 탐색을 위한 시각적 TUI와 스크립트 또는 에이전트 통합을 위한 JSON 출력 CLI를 모두 제공합니다.
  • 아키텍처 인식: Mixture-of-Experts (MoE) 아키텍처를 포함한 복잡한 모델 유형을 지원합니다.

Sources