luminal-ai/luminal

Inference at the speed of light.

何を解決するか

Luminalは、従来のディープラーニングフレームワークに見られる複雑さとパフォーマンスのオーバーヘッドを排除する高パフォーマンスな推論コンパイラです。XLAやTVMのような従来のコンパイラスタックの「複雑さの爆発」と、PyTorchのようなイージー・ファースト実行の非効率性を克服するために、すべてのニューラルネットワークを事前にコンパイル可能な静的計算グラフとして扱います。

動作方法

LuminalはRISCスタイルのアーキテクチャを採用し、すべての演算を15種類の基本演算に還元します。手動で書かれたヒューリスティクスや破壊的リライトルールに頼るのではなく、検索ベースのアプローチを用いて、最も効率的な実行パスと最適化(例:Flash Attention)を自動的に発見します。Rustで書かれており、抽象化レイヤーを回避するためにCUDAやMetalなどのアクセラレータAPIに直接アクセスします。また、シンボリック次元をサポートすることで、動的形状を扱いながらも、積極的な特殊化を維持できます。

対象ユーザー

最大の推論パフォーマンスを必要とする開発者や研究者向けです。特に、重いMLフレームワークの軽量でスタティックリンク可能なRust代替品を探している人、またはPyTorchモデルを高パフォーマンスなコンパイラバックエンドで使用したい人におすすめです。

特徴

  • PyTorch統合: torch.compileバックエンドとして動作し、ユーザーがPyTorchモデルを直接コンパイルできるようにします。
  • 極めて高いパフォーマンス: H100上でQ8 Llama 3 8Bを理論最大パフォーマンスの約80%で実行可能。
  • 検索ベースの最適化: 手動のヒューリスティクスなしで複雑な最適化を自動的に発見。
  • ミニマリストコア: コアライブラリ全体を1日で理解できるほどシンプルに設計。
  • ネイティブRust: Dockerコンテナや仮想環境を回避するスタティックリンク可能なクレート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト