Avarok-Cybersecurity/atlas

Pure Rust Inference Engine

What it solves

Atlas 是一個高效能的 LLM 推論引擎,旨在消除 Python 推論技術棧中常見的依賴地獄與不穩定性。其目標是透過硬體特定的優化來最大化本地推論速度,從而減少對昂貴 Cloud APIs 的依賴,讓強大的模型能夠在本地硬體上高效運行。

How it works

Atlas 完全使用 Rust 編寫,採用基於 traits 的模組化「即插即用」架構。這使其能夠將 HTTP API 和調度器(scheduler)與實際的模型邏輯及硬體後端解耦。Atlas 不使用通用核心(kernels),而是採用硬體與模型特定的核心(例如,針對 NVIDIA GB10 的自定義 CUDA kernels),以實現 2-3 倍的速度提升。該系統支援多種架構,包括 MoE、SSM 和 Hybrid 模型,並利用註冊系統在建置時根據硬體、模型和量化目標自動發現正確的核心。

Who it’s for

它是為想要穩定、高速本地推論環境的軟體工程師和 AI 社群所設計的。對於在 NVIDIA GB10 (DGX Spark) 硬體上進行部署的使用者特別有用,儘管其架構設計旨在最終支援 AMD、Apple Silicon 和 Intel。

Highlights

  • Pure Rust Implementation: 避免了多語言代碼庫的複雜性與不穩定性。
  • Hardware-Specific Kernels: 針對特定硬體/模型組合進行自定義調優的核心,以最大化吞吐量。
  • Modular Architecture: 基於 trait 的設計允許輕鬆整合新模型與硬體目標。
  • AI-Friendly Codebase: 專門構建,以鼓勵並促進 AI 生成的 pull requests 與貢獻。
  • Broad Model Support: 隨附對多種現代架構的支援,包括 Qwen、Gemma-4、Mistral 和 Nemotron。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案