SemiAnalysisAI/InferenceX

Open Source Continuous Inference Benchmark Research Platform — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 & soon™ TPUv6e/v7/Trainium2/3 | 开源持续推理基准研究平台 — Kimi K2.7-Code、MiniMax M3、DeepSeekv4、GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72,即将推出™ TPUv6e/v7/Trainium2/3

What it solves

InferenceX 解決了快速演進的 LLM 推理生態系統中基準測試數據過時的問題。由於軟體棧(如 vLLM 和 SGLang)透過內核優化和調度創新每日都在改進,靜態基準測試會迅速變得過時,無法代表最新軟體版本所能達到的實際性能。

How it works

它作為一個自動化、持續的基準測試研究平台。它在廣泛的高端硬體上追蹤熱門開源推理框架的即時性能,包括 NVIDIA (Blackwell, Hopper) 和 AMD (MI300 series) GPU,並透過公開的儀表板提供性能進展的即時指標。

Who it's for

此平台是為「token 工廠」的大規模運營商(如 OpenAI, Meta, Microsoft, 和 Oracle)、ML 研究人員以及需要追蹤即時性能增益和硬體對比的推理框架維護者而設計的。

Highlights

  • Continuous Tracking: 捕捉捕捉軟體驅動的性能增益,而非僅在固定時間點進行。
  • Broad Hardware Support: 正式支持廣泛的尖端加速器,包括 GB200, B200, MI325X, 和 H100。
  • Framework Agnostic: 基準測試各種行業標準棧,包括 SGLang, vLLM, 和 TensorRT-LLM。
  • Public Transparency: 為社群提供免費、開源的即時儀表板,以便社群監控推理性能曲線。