llmmanorg/llmman
Run any agent on any model, models stored as OCI images
何を解決するか
llmman は、AI エージェントとモデルを実行するための統合インターフェースであり、異なる推論サーバー、モデル形式、プロバイダーの管理の煩わしさを取り除きます。ユーザーは、ローカルマシン上でホストされているか、ホストされたプロバイダー経由で提供されているかに関わらず、任意のモデルに対して(Claude Code や Aider などのエージェントを含む)1 つのコマンドで実行できます。
仕組み
llmman は、モデルの取得、配信、ルーティングを処理する管理レイヤーです。標準的な OCI(Open Container Initiative)アーティファクトを使用してモデルをパッケージ化・保存し、Docker Hub、GHCR、または Hugging Face からモデルを取得できます。ローカル推論には、llama.cpp、vLLM、SGLang、mlx-lm などの上流エンジンをそのまま利用し、モデルファイルを変更せずに済みます。Ollama、OpenAI、Anthropic API と互換性のある単一の API エンドポイントを提供し、適切なローカルバックエンドまたはホストプロバイダーにリクエストをルーティングします。
対象ユーザー
特定のプロバイダーまたはレジストリに縛られず、さまざまなハードウェア(ローカルまたはクラウド)でさまざまなエージェントやモデルを実行したい開発者や AI 研究者。また、空気隔離環境やコンプライアンス制約のある環境で、安全で署名済みのモデル転送が必要なユーザー。
特徴
- プロバイダー・レジストリ非依存: Hugging Face や任意の OCI レジストリからモデルを直接取得し、1 つのエンドポイントを使ってローカルまたはホストプロバイダーにリクエストをルーティング。
- ワンステップ転送: モデルをローカルに保存せずに、レジストリ間(例:Hugging Face からプライベート OCI レジストリ)に直接転送可能。
- ハードウェアプール(集約): 複数のマシン上で
llmman serveを実行し、ネットワーク全体でモデル負荷を分散する単一の論理エンドポイントを構築。 - 統合 API: Ollama、OpenAI、Anthropic API を同時にサポートする単一のサーバー。
- クロスモデルハイブリッドペア: ローカルモデルのコンテキストウィンドウを超えた場合、自動的にホストプロバイダーにリクエストをルーティング。
- 安全なモデル検証: cosign 形式の署名をサポートし、レジストリから取得したモデルの正当性を検証可能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト