SemiAnalysisAI/InferenceX
Open Source Continuous Inference Benchmark Research Platform — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 & soon™ TPUv6e/v7/Trainium2/3 | 开源持续推理基准研究平台 — Kimi K2.7-Code、MiniMax M3、DeepSeekv4、GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72,即将推出™ TPUv6e/v7/Trainium2/3
解決的問題
InferenceX 解決了 AI 基準測試過時的問題。由於 LLM 推理軟體(如 vLLM 和 SGLang)透過核心最佳化與排程創新每日演進,單點時間的基準測試很快就會過時,無法反映最新軟體版本的實際性能。
工作原理
它作為一個自動化、持續性的研究平台,近乎即時地追蹤與基準測試流行的開源推理框架。透過在廣泛的高階硬體(包括 NVIDIA Blackwell、Hopper 和 AMD Instinct GPU)上持續執行評估,它能捕捉軟體堆疊改善所帶來的增量性能提升,提供性能前沿的即時指標。
適用對象
此平台專為大型「令牌工廠」(如 OpenAI、Meta 和 Microsoft)的運營者、機器學習研究人員,以及需要精確、即時硬體與軟體性能資料的推理框架開發者設計。
主要亮點
- 持續追蹤:以軟體生態系統的速度運作,提供即時性能更新。
- 廣泛硬體支援:支援大量先進 GPU,包括 GB300 NVL72、B200、MI355X 和 H100。
- 框架整合:分析主流堆疊,包括 SGLang、vLLM、TensorRT-LLM、CUDA 和 ROCm。
- 公開儀表板:提供免費、開源的即時儀表板,供公眾性能追蹤。
相關
- 專案
- 專案
- 專案
- 專案
- 專案