hybridgroup/yzma
Go with your own intelligence - Go applications that directly integrate llama.cpp for local inference using hardware acceleration.
解决的问题
yzma 为 Go 开发者提供了一种无需 C 编译器(CGo)或管理外部模型服务器,即可将本地 AI 模型推理直接集成到应用程序中的方法。它简化了在各种硬件上本地运行大型语言模型(LLM)和视觉语言模型(VLM)的过程。
工作原理
该项目作为 llama.cpp 的 Go 封装,利用 purego 和 ffi 在同一进程中调用 llama.cpp 库。这使得应用程序能够利用硬件加速(如 CUDA、Metal 或 Vulkan)实现高性能,同时保持标准的 Go 构建流程。
适用人群
希望构建具备嵌入式本地 AI 功能的应用程序,避免容器或外部推理服务器复杂性的 Go 开发者。
主要亮点
- 无需 CGo 集成:使用
purego和ffi,构建 Go 程序时无需 C 编译器。 - 广泛的硬件支持:在 Linux、macOS 和 Windows 上支持 CUDA、Metal、Vulkan、HIP、ROCm、SYCL 和 OpenCL。
- 本地推理:在与 Go 应用程序相同的进程中运行模型,实现最大性能。
- 多模态能力:支持使用 GGUF 格式模型的文本型 LLM 和视觉语言模型(VLM)。
- 简化模型管理:包含命令行工具,可直接从 Hugging Face 下载 GGUF 模型。
相关
- 项目
- 项目
- 项目
- Dispatch
- 项目