containers/ramalama
RamaLama is an open-source developer tool that simplifies the local serving of AI models from any source and facilitates their use for inference in production, all through the familiar language of containers.
What it solves
RamaLama は、AI モデルを OCI コンテナとして扱うことで、ローカルでのデプロイとサービス提供を簡素化します。大規模言語モデル(LLM)をローカルで実行する際に通常必要となる、複雑なホストシステムの依存関係、GPU ドライバ、ハードウェア最適化の手動設定が不要になります。
How it works
RamaLama はホストシステムの GPU(NVIDIA、AMD、Intel、Apple Silicon など)を検出し、必要なソフトウェア(llama.cpp や vLLM など)を含む対応するアクセラレートコンテナイメージを自動で取得します。その後、さまざまなレジストリ(Hugging Face、ModelScope、Ollama、OCI レジストリ)から AI モデルをプルし、分離された rootless コンテナ内で実行します。macOS ユーザー向けには、コンテナを使用せずに Apple Silicon 用に最適化された MLX ランタイムもサポートしています。
Who it’s for
コンテナ中心の開発パターン(Podman や Docker で使用されるもの)に慣れたエンジニアや開発者が、ローカルで AI モデルを実行したい場合に設計されています。セキュリティとハードウェアアクセラレーションを確保しながら利用できます。
Highlights
- Hardware Auto-Detection:検出された GPU(CUDA、ROCm、Vulkan など)に基づき、適切なコンテナイメージを自動選択。
- Container Isolation:モデルは rootless コンテナで実行され、デフォルトでネットワークアクセスが無く、読み取り専用ボリュームマウントによりホストシステムへの漏洩や変更を防止。
- Multi-Registry Support:Hugging Face、ModelScope、Ollama、OCI レジストリからモデルをプル可能。
- Flexible Interaction:チャットボットインターフェースまたは REST API を通じてモデルと対話できる。
- Model Conversion:ローカルモデルや GGUF ファイルを OCI イメージに変換し、配布を容易にする。