perplexityai/pplx-garden
Perplexity open source garden for inference technology
解決的問題
提供一系列高性能推理技術,專注於優化大型語言模型(LLMs)的部署與執行,著重於通訊效率、分詞與硬體特定加速。
工作原理
此倉儲扮演專用工具的「花園」角色:
- fabric-lib:使用 RDMA(遠端直接記憶體存取)進行點對點通訊,加速 LLM 系統中的資料傳輸,特別針對混合專家(MoE)調度與合併核心。
- pplx-unigram:針對 CPU 性能優化的高效能 Unigram 分詞器編碼器。
- lily:以 Rust 與 Metal 寫成的專用推理伺服器,可透過 OpenAI 相容 API 在 Apple Silicon 上執行 Qwen3.6-35B-A3B。
適用對象
致力於 LLM 推理優化、千兆參數模型的分散式系統,以及 Apple 硬體上設備端 AI 部署的機器學習工程師與研究人員。
主要亮點
- RDMA 整合:在 AWS EFA 上實現大規模模型的高效 P2P 通訊。
- 硬體加速:針對 Apple Silicon 優化的 Metal 基底推理。
- CPU 優化分詞:提升 Unigram 分詞器編碼器的效能。
- 解耦架構:支援解耦的預填入(prefill)與解碼(decode)流程。
相關
- 專案
- 專案
- 專案
- 專案