SemiAnalysisAI/InferenceX
Open Source Continuous Inference Benchmark Research Platform — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 & soon™ TPUv6e/v7/Trainium2/3 | 开源持续推理基准研究平台 — Kimi K2.7-Code、MiniMax M3、DeepSeekv4、GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72,即将推出™ TPUv6e/v7/Trainium2/3
解決する課題
InferenceXは、AIベンチマークが古くなりがちな問題に対処します。LLM推論ソフトウェア(vLLMやSGLangなど)は、カーネル最適化やスケジューリングの革新を通じて日々進化しているため、一点でのベンチマークはすぐに陳腐化し、最新のソフトウェアリリースの実際のパフォーマンスを反映できなくなります。
動作方法
これは、近似リアルタイムで人気のあるオープンソース推論フレームワークを追跡・ベンチマークする自動化された継続的リサーチプラットフォームです。NVIDIA Blackwell、Hopper、AMD Instinct GPUを含む幅広いハイエンドハードウェア上で継続的に評価を実行することで、ソフトウェアスタックの改善に伴う段階的なパフォーマンス向上を捉え、パフォーマンスの最前線をリアルタイムで示します。
対象ユーザー
このプラットフォームは、大規模な「トークン工場」(OpenAI、Meta、Microsoftなど)を運用するオペレーター、ML研究者、推論フレームワークを使用する開発者向けに設計されており、ハードウェアおよびソフトウェアパフォーマンスに関する正確で最新のデータが必要な方々に最適です。
主な特徴
- 継続的追跡: ソフトウェアエコシステムのスピードに合わせ、リアルタイムのパフォーマンス更新を提供。
- 広範なハードウェア対応: GB300 NVL72、B200、MI355X、H100を含む最先端GPUの多数をサポート。
- フレームワーク統合: SGLang、vLLM、TensorRT-LLM、CUDA、ROCmなどの主要スタックを分析。
- 公開ダッシュボード: 公開・オープンソースのライブダッシュボードを無料で提供し、パフォーマンスを公開追跡可能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト