SemiAnalysisAI/InferenceX
Open Source Continuous Inference Benchmark Research Platform — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 & soon™ TPUv6e/v7/Trainium2/3 | 开源持续推理基准研究平台 — Kimi K2.7-Code、MiniMax M3、DeepSeekv4、GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72,即将推出™ TPUv6e/v7/Trainium2/3
What it solves
InferenceX は、急速に進化する LLM 推論エコシステムにおけるベンチマークの陳腐化の問題に対処します。ソフトウェアスタック(vLLM や SGLang など)がカーネル最適化やスケジューリングの革新を通じて日々進化しているため、静的なベンチマークはすぐに古くなり、最新のソフトウェアリリースが達成できる実際の性能を代表しなくなります。
How it works
自動化された継続的なベンチマーク研究プラットフォームとして機能します。NVIDIA (Blackwell, Hopper) や AMD (MI300 series) GPU を含む幅広いハイエンドハードウェア上で、人気のオープンソース推論フレームワークのリアルタイム性能を追跡し、、透過的な公開ダッシュボードを通じて性能の進展をリアルタイムに示します。
Who it's for
このプラットフォームは、大規模な「token ファクトリー」のオペレーター(OpenAI, Meta, Microsoft, Oracle など)、ML 研究者、およびリアルタイムの性能向上とハードウェア比較が必要な推論フレームワークのメンテナーです。
Highlights
- Continuous Tracking: 固定された時点ではなく、ソフトウェア駆動の性能向上をほぼリアルタイムで捕捉します。
- Broad Hardware Support: GB200, B200, MI325X, H100 などの最先端のアクセラレータを幅広く公式サポートしています。
- Framework Agnostic: SGLang, vLLM, vLLM, TensorRT-LLM など、業界標準のスタックを幅広くベンチマークします。
- Public Transparency: コミュニティが推論性能の曲線を見守るための、無料、オープンソースのライブダッシュボードを提供します。