Mesh-LLM/mesh-llm
Distributed AI/LLM for the people. Share compute privately or publicly to power your agents and chat.
解決する課題
Mesh LLMは、複数のマシンを連携させることで、大規模言語モデルの実行におけるハードウェアの制限を解決します。ワークロードをネットワーク上のノードに分散させることで、単一のデバイスでは大きすぎるモデルの実行を可能にし、クラスター全体に対して統一されたOpenAI互換APIを提供します。
仕組み
このシステムは、各ノードが同じAPIを公開するメッシュアーキテクチャを採用しています。リクエストが届くと、メッシュは要求されたモデルに基づいて適切なピアにルーティングします。モデルが1台のマシンに対して大きすぎる場合、システムは「Skippy stage splits」を使用してモデルのレイヤーを異なるノードに分散させます。また、単一のプロンプトをメッシュ内の複数のモデルに展開し、仲裁して単一のレスポンスを返す実験的な「Mixture-of-Agents」モードも備えています。
対象ユーザー
- 個人ユーザー: 既存の複数のコンピュータを接続して、巨大なモデルを実行したい方。
- 開発者: 分散モデル推論のためにOpenAI互換のインターフェースを必要とする方。
- オペレーター: 共有AIコンピューティングのために、プライベートまたはパブリックなハードウェアメッシュを構築したい方。
ハイライト
- 分散推論: 複数のマシンにわたってGPUとメモリを集約。
- OpenAI互換性: 標準的な
/v1APIを公開し、既存のツールとの容易な統合が可能。 - ステージ分割: Skippyランタイムを使用して、大きなモデルを管理可能なレイヤーとしてノード間に分割。
- メッシュ・ディスカバリ: Nostrによるパブリックなディスカバリ、または招待トークンによるプライベートなメッシュをサポート。
- マルチモデル仲裁: 複数のモデルからのレスポンスを集約する実験的なMixture-of-Agents (MoA) 機能。