hybridgroup/yzma

Go with your own intelligence - Go applications that directly integrate llama.cpp for local inference using hardware acceleration.

解决的问题

yzma 为 Go 开发者提供了一种无需 C 编译器(CGo)或管理外部模型服务器,即可将本地 AI 模型推理直接集成到应用程序中的方法。它简化了在各种硬件上本地运行大型语言模型(LLM)和视觉语言模型(VLM)的过程。

工作原理

该项目作为 llama.cpp 的 Go 封装,利用 puregoffi 在同一进程中调用 llama.cpp 库。这使得应用程序能够利用硬件加速(如 CUDA、Metal 或 Vulkan)实现高性能,同时保持标准的 Go 构建流程。

适用人群

希望构建具备嵌入式本地 AI 功能的应用程序,避免容器或外部推理服务器复杂性的 Go 开发者。

主要亮点

  • 无需 CGo 集成:使用 puregoffi,构建 Go 程序时无需 C 编译器。
  • 广泛的硬件支持:在 Linux、macOS 和 Windows 上支持 CUDA、Metal、Vulkan、HIP、ROCm、SYCL 和 OpenCL。
  • 本地推理:在与 Go 应用程序相同的进程中运行模型,实现最大性能。
  • 多模态能力:支持使用 GGUF 格式模型的文本型 LLM 和视觉语言模型(VLM)。
  • 简化模型管理:包含命令行工具,可直接从 Hugging Face 下载 GGUF 模型。

相关

  • 项目
  • 项目
  • 项目
  • Dispatch
  • 项目