EricLBuehler/mistral.rs
Fast, flexible LLM inference
해결하는 문제
mistral.rs는 대규모 모델을 로컬 또는 프로덕션 환경에서 설정 없이 실행할 수 있도록 설계된 고성능 LLM 추론 엔진입니다. 수동 설정, 양자화 및 하드웨어 최적화의 번거로움을 제거하여 사용자가 단 하나의 명령어로 모든 Hugging Face 모델을 실행할 수 있게 합니다.
작동 원리
이 엔진은 Candle 프레임워크를 기반으로 구축되었으며 다양한 하드웨어 가속기(CUDA, Metal, CPU)를 지원합니다. Continuous batching, PagedAttention, FlashAttention V2/V3를 사용하여 처리량을 극대화합니다. 모델 아키텍처, 양자화 형식 및 채팅 템플릿을 자동 감지하는 제로 설정 CLI를 제공합니다. 서빙을 위해 OpenAI 호환 및 Anthropic 호환 API를 노출하며, 모델과 상호 작용하기 위한 내장 웹 UI를 포함합니다.
대상 사용자
- 개발자: Python 또는 Rust SDK를 사용하여 AI 애플리케이션을 구축하는 개발자.
- MLOps 엔지니어: Prometheus 메트릭 및 Docker 지원을 통해 LLM을 배포하는 엔지니어.
- SRE: 멀티 GPU 및 분산 추론 기능을 갖춘 고처리량 추론 서버를 찾는 SRE.
- AI 연구자: 멀티모달 모델(텍스트, 비전, 비디오, 오디오) 및 다양한 양자화 방법을 실험하는 연구자.
주요 특징
- 제로 설정 실행:
mistralrs run -m user/model를 통해 모든 Hugging Face 모델을 즉시 실행. - 진정한 멀티모달성: 하나의 엔진에서 텍스트, 비전, 비디오, 오디오 및 음성 생성을 통합 지원.
- 에이전트 런타임: 도구 호출, 로컬 Python 코드 실행, 셸 실행 및 웹 검색에 대한 내장 지원.
- OpenAI 및 Anthropic 호환성: Anthropic Messages API 지원을 포함하여 이러한 API의 드롭인 대체제로 기능.
- 스마트 양자화: 하드웨어에 따라 최적의 양자화 형식(예: ISQ, GGUF, GPTQ, AWQ)을 자동으로 선택.
- 분산 추론: NCCL TP를 사용하여 멀티 GPU 및 멀티 노드 분산 추론을 지원.
- 내장 웹 UI: 추론, 코드 실행 및 파일 관리를 위한 네이티브 인터페이스 포함.