Mesh-LLM/mesh-llm
Distributed AI/LLM for the people. Share compute privately or publicly to power your agents and chat.
何を解決するか
Mesh LLM は、複数のマシンにまたがるGPUとメモリリソースを統合し、単一のコンピュータでは実行できないほど大きな言語モデル(LLM)を実行できるようにします。統一されたOpenAI互換APIを提供しており、既存のAIツールとの統合が容易で、ネットワーク上のピア間で計算負荷を分散できます。
動作方法
- 分散ルーティング:メッシュネットワーク内のすべてのノードが同じAPIを公開します。リクエストは、特定のモデルをホストできるピアにルーティングされます。
- スキッピーステージ分割:単一のマシンの容量を超えるモデルの場合、システムは「ステージ分割」を使用してモデルを連続するレイヤー範囲に分割し、複数のノードに分散します。各ノードはモデルの一部を処理し、活性化値を次のステージに渡します。
- 暗号化トランスポート:ノード間の通信(推論リクエストやモデル活性化値など)は、QUICを使用してエンドツーエンド暗号化されます。
- ディスカバリ:ノードはNostrディスカバリ経由でパブリックメッシュに参加できるほか、招待トークンを使用してプライベートメッシュに参加できます。
- エージェントの混合(MoA):実験的な機能で、単一のプロンプトをメッシュ内のすべてのモデルに展開し、応答を仲裁して単一の統合された返答を返します。
対象ユーザー
- ハードウェア制約のあるユーザー:コンシューマー向けハードウェア上で大規模モデルを実行したい人。
- 開発者:分散LLMサーバー用のOpenAI互換エンドポイントが必要な人。
- システム運用者:プライベートまたはパブリックな分散推論クラスタを構築したい人。
特徴
- OpenAI互換API:既存のLLMアプリケーションとのシームレスな統合。
- 広範なモデル対応:GGUFベースのモデルファミリー(Qwen、Llama、Mistral、DeepSeekなど)を多数サポート。
- クロスプラットフォーム:macOS、Linux、Windowsに対応(CUDA、ROCm、Vulkan、Metalサポート)。
- 動的スケーリング:1ノードから開始し、必要に応じてメッシュにノードを追加可能。
関連
- Dispatch
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト