llmmanorg/llmman

Run any agent on any model, models stored as OCI images

何を解決するか

llmman は、AI エージェントとモデルを実行するための統合インターフェースであり、異なる推論サーバー、モデル形式、プロバイダーの管理の煩わしさを取り除きます。ユーザーは、ローカルマシン上でホストされているか、ホストされたプロバイダー経由で提供されているかに関わらず、任意のモデルに対して(Claude Code や Aider などのエージェントを含む)1 つのコマンドで実行できます。

仕組み

llmman は、モデルの取得、配信、ルーティングを処理する管理レイヤーです。標準的な OCI(Open Container Initiative)アーティファクトを使用してモデルをパッケージ化・保存し、Docker Hub、GHCR、または Hugging Face からモデルを取得できます。ローカル推論には、llama.cppvLLMSGLangmlx-lm などの上流エンジンをそのまま利用し、モデルファイルを変更せずに済みます。Ollama、OpenAI、Anthropic API と互換性のある単一の API エンドポイントを提供し、適切なローカルバックエンドまたはホストプロバイダーにリクエストをルーティングします。

対象ユーザー

特定のプロバイダーまたはレジストリに縛られず、さまざまなハードウェア(ローカルまたはクラウド)でさまざまなエージェントやモデルを実行したい開発者や AI 研究者。また、空気隔離環境やコンプライアンス制約のある環境で、安全で署名済みのモデル転送が必要なユーザー。

特徴

  • プロバイダー・レジストリ非依存: Hugging Face や任意の OCI レジストリからモデルを直接取得し、1 つのエンドポイントを使ってローカルまたはホストプロバイダーにリクエストをルーティング。
  • ワンステップ転送: モデルをローカルに保存せずに、レジストリ間(例:Hugging Face からプライベート OCI レジストリ)に直接転送可能。
  • ハードウェアプール(集約): 複数のマシン上で llmman serve を実行し、ネットワーク全体でモデル負荷を分散する単一の論理エンドポイントを構築。
  • 統合 API: Ollama、OpenAI、Anthropic API を同時にサポートする単一のサーバー。
  • クロスモデルハイブリッドペア: ローカルモデルのコンテキストウィンドウを超えた場合、自動的にホストプロバイダーにリクエストをルーティング。
  • 安全なモデル検証: cosign 形式の署名をサポートし、レジストリから取得したモデルの正当性を検証可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト