SemiAnalysisAI/InferenceX

Open Source Continuous Inference Benchmark Research Platform — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 & soon™ TPUv6e/v7/Trainium2/3 | 开源持续推理基准研究平台 — Kimi K2.7-Code、MiniMax M3、DeepSeekv4、GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72,即将推出™ TPUv6e/v7/Trainium2/3

解決的問題

InferenceX 解決了 AI 基準測試過時的問題。由於 LLM 推理軟體(如 vLLM 和 SGLang)透過核心最佳化與排程創新每日演進,單點時間的基準測試很快就會過時,無法反映最新軟體版本的實際性能。

工作原理

它作為一個自動化、持續性的研究平台,近乎即時地追蹤與基準測試流行的開源推理框架。透過在廣泛的高階硬體(包括 NVIDIA Blackwell、Hopper 和 AMD Instinct GPU)上持續執行評估,它能捕捉軟體堆疊改善所帶來的增量性能提升,提供性能前沿的即時指標。

適用對象

此平台專為大型「令牌工廠」(如 OpenAI、Meta 和 Microsoft)的運營者、機器學習研究人員,以及需要精確、即時硬體與軟體性能資料的推理框架開發者設計。

主要亮點

  • 持續追蹤:以軟體生態系統的速度運作,提供即時性能更新。
  • 廣泛硬體支援:支援大量先進 GPU,包括 GB300 NVL72、B200、MI355X 和 H100。
  • 框架整合:分析主流堆疊,包括 SGLang、vLLM、TensorRT-LLM、CUDA 和 ROCm。
  • 公開儀表板:提供免費、開源的即時儀表板,供公眾性能追蹤。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案