perplexityai/pplx-garden

Perplexity open source garden for inference technology

解決的問題

提供一系列高性能推理技術,專注於優化大型語言模型(LLMs)的部署與執行,著重於通訊效率、分詞與硬體特定加速。

工作原理

此倉儲扮演專用工具的「花園」角色:

  • fabric-lib:使用 RDMA(遠端直接記憶體存取)進行點對點通訊,加速 LLM 系統中的資料傳輸,特別針對混合專家(MoE)調度與合併核心。
  • pplx-unigram:針對 CPU 性能優化的高效能 Unigram 分詞器編碼器。
  • lily:以 Rust 與 Metal 寫成的專用推理伺服器,可透過 OpenAI 相容 API 在 Apple Silicon 上執行 Qwen3.6-35B-A3B。

適用對象

致力於 LLM 推理優化、千兆參數模型的分散式系統,以及 Apple 硬體上設備端 AI 部署的機器學習工程師與研究人員。

主要亮點

  • RDMA 整合:在 AWS EFA 上實現大規模模型的高效 P2P 通訊。
  • 硬體加速:針對 Apple Silicon 優化的 Metal 基底推理。
  • CPU 優化分詞:提升 Unigram 分詞器編碼器的效能。
  • 解耦架構:支援解耦的預填入(prefill)與解碼(decode)流程。

相關

  • 專案
  • 專案
  • 專案
  • 專案