Mesh-LLM/mesh-llm

Distributed AI/LLM for the people. Share compute privately or publicly to power your agents and chat.

解決する課題

Mesh LLMは、複数のマシンを連携させることで、大規模言語モデルの実行におけるハードウェアの制限を解決します。ワークロードをネットワーク上のノードに分散させることで、単一のデバイスでは大きすぎるモデルの実行を可能にし、クラスター全体に対して統一されたOpenAI互換APIを提供します。

仕組み

このシステムは、各ノードが同じAPIを公開するメッシュアーキテクチャを採用しています。リクエストが届くと、メッシュは要求されたモデルに基づいて適切なピアにルーティングします。モデルが1台のマシンに対して大きすぎる場合、システムは「Skippy stage splits」を使用してモデルのレイヤーを異なるノードに分散させます。また、単一のプロンプトをメッシュ内の複数のモデルに展開し、仲裁して単一のレスポンスを返す実験的な「Mixture-of-Agents」モードも備えています。

対象ユーザー

  • 個人ユーザー: 既存の複数のコンピュータを接続して、巨大なモデルを実行したい方。
  • 開発者: 分散モデル推論のためにOpenAI互換のインターフェースを必要とする方。
  • オペレーター: 共有AIコンピューティングのために、プライベートまたはパブリックなハードウェアメッシュを構築したい方。

ハイライト

  • 分散推論: 複数のマシンにわたってGPUとメモリを集約。
  • OpenAI互換性: 標準的な /v1 APIを公開し、既存のツールとの容易な統合が可能。
  • ステージ分割: Skippyランタイムを使用して、大きなモデルを管理可能なレイヤーとしてノード間に分割。
  • メッシュ・ディスカバリ: Nostrによるパブリックなディスカバリ、または招待トークンによるプライベートなメッシュをサポート。
  • マルチモデル仲裁: 複数のモデルからのレスポンスを集約する実験的なMixture-of-Agents (MoA) 機能。