perplexityai/pplx-garden

Perplexity open source garden for inference technology

해결하는 문제

대규모 언어 모델(LLM)의 배포 및 실행을 최적화하기 위해 설계된 고성능 추론 기술의 모음으로, 통신 효율성, 토큰화, 하드웨어 특화 가속에 중점을 둡니다.

작동 방식

이 리포지토리는 전문적인 도구의 '정원'으로 기능합니다:

  • fabric-lib: RDMA(원격 직접 메모리 액세스)를 사용하여 LLM 시스템 내 데이터 전송을 가속화하는 포인트투포인트 통신을 제공하며, 특히 Mixture-of-Experts(MoE) 디스패치 및 컨바인 커널에 특화되어 있습니다.
  • pplx-unigram: CPU 성능을 최적화한 고성능 Unigram 토크나이저 인코더입니다.
  • lily: Rust와 Metal로 작성된 전용 추론 서버로, OpenAI 호환 API를 통해 Apple Silicon에서 Qwen3.6-35B-A3B를 실행할 수 있습니다.

대상 사용자

LLM 추론 최적화, 트리리온 파라미터 모델을 위한 분산 시스템, Apple 하드웨어에서의 온디바이스 AI 배포에 종사하는 머신러닝 엔지니어 및 연구자입니다.

주요 특징

  • RDMA 통합: AWS EFA에서 대규모 모델의 효율적인 P2P 통신을 가능하게 합니다.
  • 하드웨어 가속: Apple Silicon용으로 최적화된 Metal 기반 추론.
  • CPU 최적화 토큰화: Unigram 토크나이저 인코더의 성능 향상.
  • 비통합 아키텍처: 비통합된 프리필 및 디코딩 프로세스를 지원합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트