thu-pacman/chitu
High-performance inference framework for large language models, focusing on efficiency, flexibility, and availability.
What it solves
Chitu 是一个具备生产级别的大模型推理引擎,旨在弥合小规模 AI 实验与大型企业部署之间的鸿沟。它解决了需要高性能推理框架的问题,该框架必须足够灵活以适应多样化的硬件环境,同时又足够稳定以支持并发的业务流量。
How it works
Chitu 提供可扩展的推理解决方案,支持从纯 CPU 部署、单 GPU 设置到大规模集群的各种硬件配置。它使用高效的算子进行在线量化转换(例如 FP4 转 FP8/BF16),并支持异构混合推理(CPU+GPU),使得在受限硬件上也能部署如 DeepSeek‑R1 671B 这样的巨型模型。
Who it’s for
此引擎面向需要在生产环境中跨各种硬件后端部署大型语言模型(LLM)的企业和开发者,支持 NVIDIA GPU 以及多种国产 AI 芯片(如 Ascend、Moore Threads、Muxi、海光)。
Highlights
- Broad Hardware Compatibility: Supports NVIDIA GPUs, Ascend 910B, Moore Threads, Muxi, and Haiguang chips.
- Flexible Deployment: Offers a single-file executable (
chitu.run) for complex tasks like multi-node, multi-instance, and PD separation. - High-Performance Quantization: Implements efficient operators for FP4, FP8, and BF16 conversions.
- Wide Model Support: Compatible with major models including DeepSeek, Qwen, GLM, and Kimi.