luminal-ai/luminal
Inference at the speed of light.
해결하는 문제
Luminal은 전통적인 딥러닝 프레임워크에서 발생하는 복잡성과 성능 오버헤드를 제거하기 위해 설계된 고성능 추론 컴파일러입니다. XLA나 TVM과 같은 기존 컴파일러 스택의 '복잡성 폭발'과 PyTorch와 같은 이지-프리스트 실행의 비효율성을 극복하기 위해, 모든 신경망을 사전에 컴파일 가능한 정적 계산 그래프로 간주하여 최대한의 하드웨어 효율성을 달성합니다.
작동 방식
Luminal은 RISC 스타일 아키텍처를 사용하여 모든 연산을 15개의 기본 연산으로 축소합니다. 수작업 히ュ리스틱스나 파괴적 리라이트 규칙에 의존하지 않고, 검색 기반 접근 방식을 통해 가장 효율적인 실행 경로와 최적화(예: Flash Attention)를 자동으로 탐색합니다. Rust로 작성되어 있으며, 추상화 계층을 피하기 위해 CUDA, Metal 등의 가속기 API에 직접 접근합니다. 또한 심볼릭 차원을 지원하여 동적 형태를 처리하면서도 강력한 특수화가 가능합니다.
대상 사용자
어떤 디바이스에서도 최대의 추론 성능이 필요한 개발자 및 연구자들을 위한 것입니다. 특히 무거운 ML 프레임워크의 가벼운 스태틱 링크 가능한 Rust 대안을 찾는 사람, 또는 PyTorch 모델을 고성능 컴파일러 백엔드와 함께 사용하고 싶은 사람에게 적합합니다.
주요 특징
- PyTorch 통합:
torch.compile백엔드로 작동하여 사용자가 PyTorch 모델을 직접 컴파일할 수 있습니다. - 극한의 성능: H100에서 Q8 Llama 3 8B를 이론적 최대 성능의 약 80%로 실행할 수 있습니다.
- 검색 기반 최적화: 수동 히ュ리스틱스 없이 복잡한 최적화를 자동으로 발견합니다.
- 미니멀한 코어: 전체 코어 라이브러리를 하루 만에 이해할 수 있을 정도로 단순하게 설계되었습니다.
- 네이티브 Rust: Docker 컨테이너와 가상 환경을 피하는 스태틱 링크 가능한 크레이트입니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트