Avarok-Cybersecurity/atlas

Pure Rust Inference Engine

해결하는 문제

Atlas는 Python 기반 추론 스택에서 흔히 발견되는 의존성 지옥과 불안정성을 제거하기 위해 설계된 고성능 LLM 추론 엔진입니다. 하드웨어 특화 최적화를 통해 로컬 추론 속도를 극대화함으로써 값비싼 Cloud API에 대한 의존도를 낮추는 것을 목표로 하며, 강력한 모델을 로컬 하드웨어에서 효율적으로 실행할 수 있도록 합니다.

작동 방식

전체적으로 Rust로 구축된 Atlas는 trait 기반의 모듈형 "plug-and-play" 아키텍처를 사용합니다. 이를 통해 HTTP API 및 스케줄러를 실제 모델 로직 및 하드웨어 백엔드로부터 분리할 수 있습니다. 범용 커널 대신 Atlas는 하드웨어 및 모델 특화 커널(예: NVIDIA GB10을 위한 커스텀 CUDA 커널)을 사용하여 2-3배의 속도 향상을 달성합니다. 이 시스템은 MoE, SSM, Hybrid 모델을 포함한 다양한 아키텍처를 지원하며, 하드웨어, 모델 및 양자화 대상에 따라 빌드 시점에 올바른 커널을 자동으로 검색하는 레지스트리 시스템을 활용합니다.

대상 사용자

안정적이고 빠른 로컬 추론 환경을 원하는 소프트웨어 엔지니어와 AI 커뮤니티를 위해 설계되었습니다. 특히 NVIDIA GB10 (DGX Spark) 하드웨어에 배포하는 사용자에게 유용하지만, 향후 AMD, Apple Silicon, Intel을 지원하도록 설계되었습니다.

주요 특징

  • Pure Rust Implementation: 다국어 코드베이스의 복잡성과 불안정성을 피합니다.
  • Hardware-Specific Kernels: 처리량을 극대화하기 위해 특정 하드웨어/모델 조합에 맞게 커스텀 튜닝된 커널을 사용합니다.
  • Modular Architecture: Trait 기반 설계로 새로운 모델과 하드웨어 대상을 쉽게 통합할 수 있습니다.
  • AI-Friendly Codebase: AI가 생성한 pull request 및 기여를 장려하고 촉진할 수 있도록 특별히 구조화되었습니다.
  • Broad Model Support: Qwen, Gemma-4, Mistral, Nemotron을 포함한 광범위한 현대적 아키텍처를 지원합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트