containers/ramalama

RamaLama is an open-source developer tool that simplifies the local serving of AI models from any source and facilitates their use for inference in production, all through the familiar language of containers.

What it solves

RamaLama 簡化了 AI 模型的本機部署與服務,將模型視為 OCI 容器。它免除使用者手動設定複雜的主機系統相依、GPU 驅動與硬體最佳化的需求,這些通常是本機執行大型語言模型(LLM)所必須的。

How it works

RamaLama 會偵測主機系統的 GPU(NVIDIA、AMD、Intel、Apple Silicon 等),自動下載對應的加速容器映像,內含所需軟體(如 llama.cpp 或 vLLM)。接著從各種註冊表(Hugging Face、ModelScope、Ollama 或 OCI 註冊表)拉取 AI 模型,並在隔離的無根容器中執行。對於 macOS 使用者,亦支援 MLX 執行階段,以在 Apple Silicon 上進行最佳化推論,且不需要容器。

Who it’s for

此工具設計給希望以熟悉的容器開發模式(如 Podman 或 Docker)在本機執行 AI 模型的工程師與開發者,同時確保安全性與硬體加速。

Highlights

  • Hardware Auto-Detection:自動根據偵測到的 GPU(CUDA、ROCm、Vulkan 等)選擇正確的容器映像。
  • Container Isolation:模型在無根容器中執行,預設無網路存取,且以唯讀卷掛載防止主機系統洩漏或被修改。
  • Multi-Registry Support:支援從 Hugging Face、ModelScope、Ollama 以及 OCI 註冊表拉取模型。
  • Flexible Interaction:允許使用者透過聊天機器人介面或 REST API 與模型互動。
  • Model Conversion:可將本機模型或 GGUF 檔案轉換為 OCI 映像,以便更容易分發。