SemiAnalysisAI/InferenceX
Open Source Continuous Inference Benchmark Research Platform — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 & soon™ TPUv6e/v7/Trainium2/3 | 开源持续推理基准研究平台 — Kimi K2.7-Code、MiniMax M3、DeepSeekv4、GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72,即将推出™ TPUv6e/v7/Trainium2/3
What it solves
InferenceX 解决了快速演进的 LLM 推理生态系统中基准测试数据过时的问题。由于软件栈(如 vLLM 和 SGLang)通过内核优化和调度创新每日都在改进,静态基准测试会迅速变得过时,无法代表最新软件版本所能达到的实际性能。
How it works
它作为一个自动化的、持续的基准测试研究平台。它在广泛的高端硬件上追踪热门开源推理框架的实时性能,包括 NVIDIA (Blackwell, Hopper) 和 AMD (MI300 series) GPU,,通过公开的仪表板提供性能进度的实时指标。
Who it's for
此平台是为“token 工厂”的大规模运营商(如 OpenAI, Meta, Microsoft, 和 Oracle),ML 研究人员,以及需要追踪实时性能增益和硬件对比的推理框架维护者而设计的。
Highlights
- Continuous Tracking: 捕捉软件驱动的性能增益,而非仅在固定时间点进行。
- Broad Hardware Support: 正式支持广泛的尖端加速器,包括 GB200, B200, MI325X, 和 H100。
- Framework Agnostic: 基准测试各种行业标准栈,包括 SGLang, vLLM, 和 TensorRT-LLM。
- Public Transparency: 提供免费、开源的实时仪表板,供社区进行推理性能曲线的监控。