perplexityai/pplx-garden

Perplexity open source garden for inference technology

解决的问题

提供一系列高性能推理技术,旨在优化大型语言模型(LLMs)的部署与运行,重点关注通信效率、分词和硬件特定加速。

工作原理

该仓库充当一系列专用工具的「花园」:

  • fabric-lib:使用 RDMA(远程直接内存访问)实现点对点通信,加速 LLM 系统中的数据传输,特别针对混合专家(MoE)调度和合并内核。
  • pplx-unigram:专为 CPU 性能优化的高性能 Unigram 分词器编码器。
  • lily:使用 Rust 和 Metal 编写的专用推理服务器,可通过 OpenAI 兼容 API 在 Apple Silicon 上运行 Qwen3.6-35B-A3B。

适用人群

致力于 LLM 推理优化、万亿参数模型分布式系统以及 Apple 硬件上设备端 AI 部署的机器学习工程师和研究人员。

主要亮点

  • RDMA 集成:在 AWS EFA 上实现大规模模型的高效 P2P 通信。
  • 硬件加速:针对 Apple Silicon 优化的 Metal 基础推理。
  • CPU 优化分词:提升 Unigram 分词器编码器的性能。
  • 解耦架构:支持解耦的预填充(prefill)和解码(decode)流程。

相关

  • 项目
  • 项目
  • 项目
  • 项目