luminal-ai/luminal
Inference at the speed of light.
何を解決するか
Luminalは、従来のディープラーニングフレームワークに見られる複雑さとパフォーマンスのオーバーヘッドを排除する高パフォーマンスな推論コンパイラです。XLAやTVMのような従来のコンパイラスタックの「複雑さの爆発」と、PyTorchのようなイージー・ファースト実行の非効率性を克服するために、すべてのニューラルネットワークを事前にコンパイル可能な静的計算グラフとして扱います。
動作方法
LuminalはRISCスタイルのアーキテクチャを採用し、すべての演算を15種類の基本演算に還元します。手動で書かれたヒューリスティクスや破壊的リライトルールに頼るのではなく、検索ベースのアプローチを用いて、最も効率的な実行パスと最適化(例:Flash Attention)を自動的に発見します。Rustで書かれており、抽象化レイヤーを回避するためにCUDAやMetalなどのアクセラレータAPIに直接アクセスします。また、シンボリック次元をサポートすることで、動的形状を扱いながらも、積極的な特殊化を維持できます。
対象ユーザー
最大の推論パフォーマンスを必要とする開発者や研究者向けです。特に、重いMLフレームワークの軽量でスタティックリンク可能なRust代替品を探している人、またはPyTorchモデルを高パフォーマンスなコンパイラバックエンドで使用したい人におすすめです。
特徴
- PyTorch統合:
torch.compileバックエンドとして動作し、ユーザーがPyTorchモデルを直接コンパイルできるようにします。 - 極めて高いパフォーマンス: H100上でQ8 Llama 3 8Bを理論最大パフォーマンスの約80%で実行可能。
- 検索ベースの最適化: 手動のヒューリスティクスなしで複雑な最適化を自動的に発見。
- ミニマリストコア: コアライブラリ全体を1日で理解できるほどシンプルに設計。
- ネイティブRust: Dockerコンテナや仮想環境を回避するスタティックリンク可能なクレート。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト