perplexityai/pplx-garden
Perplexity open source garden for inference technology
解决的问题
提供一系列高性能推理技术,旨在优化大型语言模型(LLMs)的部署与运行,重点关注通信效率、分词和硬件特定加速。
工作原理
该仓库充当一系列专用工具的「花园」:
- fabric-lib:使用 RDMA(远程直接内存访问)实现点对点通信,加速 LLM 系统中的数据传输,特别针对混合专家(MoE)调度和合并内核。
- pplx-unigram:专为 CPU 性能优化的高性能 Unigram 分词器编码器。
- lily:使用 Rust 和 Metal 编写的专用推理服务器,可通过 OpenAI 兼容 API 在 Apple Silicon 上运行 Qwen3.6-35B-A3B。
适用人群
致力于 LLM 推理优化、万亿参数模型分布式系统以及 Apple 硬件上设备端 AI 部署的机器学习工程师和研究人员。
主要亮点
- RDMA 集成:在 AWS EFA 上实现大规模模型的高效 P2P 通信。
- 硬件加速:针对 Apple Silicon 优化的 Metal 基础推理。
- CPU 优化分词:提升 Unigram 分词器编码器的性能。
- 解耦架构:支持解耦的预填充(prefill)和解码(decode)流程。
相关
- 项目
- 项目
- 项目
- 项目