perplexityai/pplx-garden

Perplexity open source garden for inference technology

何を解決するか

大規模言語モデル(LLM)のデプロイと実行を最適化するための高性能推論技術のコレクションを提供し、通信効率、トークン化、ハードウェア固有の加速に焦点を当てています。

動作方法

このリポジトリは、専門的なツールの「庭園」として機能します:

  • fabric-lib: RDMA(リモート直接メモリアクセス)を用いてポイントツーポイント通信を行い、LLMシステムにおけるデータ転送を高速化します。特にMixture-of-Experts(MoE)のディスパッチおよびコンバインカーネルに特化しています。
  • pplx-unigram: CPUパフォーマンスを最適化した高性能Unigramトークナイザー・エンコーダー。
  • lily: RustとMetalで書かれた専用の推論サーバーで、OpenAI互換APIを介してApple Silicon上でQwen3.6-35B-A3Bを実行可能にします。

対象ユーザー

LLM推論最適化、トランジリオンパラメータモデル向け分散システム、Appleハードウェア上のオンデバイスAIデプロイに取り組む機械学習エンジニアおよび研究者。

主な特徴

  • RDMA統合: AWS EFA上で大規模モデルの効率的なP2P通信を可能にします。
  • ハードウェア加速: Apple Silicon向けに最適化されたMetalベースの推論。
  • CPU最適化トークン化: Unigramトークナイザー・エンコーダーのパフォーマンス向上。
  • 非統合アーキテクチャ: 非統合されたプリフィルとデコードプロセスをサポートします。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト