scaleapi/llm-engine

Scale LLM Engine public repository

何を解決するか

大規模言語モデル(LLM)のデプロイとファインチューニングは、しばしば高コストであり、大きなインフラ構成と機械学習の専門知識を必要とします。LLM Engineは、ファウンデーションモデルを一元的に提供・カスタマイズする方法を提供することで、新しいモデルや技術が登場してもインフラの維持管理の複雑さを軽減します。

動作方法

LLM EngineはPythonライブラリ、コマンドラインインターフェース(CLI)、Helmチャートとして提供されます。ユーザーはScaleのホストされたインフラストラクチャ経由でモデルにアクセスするか、自前のKubernetesベースのクラウドインフラにデプロイできます。Hugging Faceと統合されており、1つのコマンドでHugging Faceのモデルを簡単にデプロイでき、ストリーミング応答と動的バッチ処理による最適化された推論をサポートしています。

対象ユーザー

LLaMA、MPT、Falconなどのオープンソースのファウンデーションモデルを、下層のインフラの複雑さを手動で管理せずにデプロイ・提供・ファインチューニングしたい開発者やMLエンジニア。

主な特徴

  • 即時利用可能なAPI: 人気のあるオープンソースモデルの迅速なデプロイと提供。
  • ファインチューニング機能: 専有データを使用してファウンデーションモデルをカスタマイズし、パフォーマンスを向上。
  • 最適化された推論: 動的バッチ処理とストリーミングにより、高スループットと低レイテンシを実現。
  • Hugging Face統合: Hugging Faceハブのモデルをシームレスにデプロイ可能。

関連

  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch