hybridgroup/yzma

Go with your own intelligence - Go applications that directly integrate llama.cpp for local inference using hardware acceleration.

解決的問題

yzma 為 Go 開發者提供了一種方法,可在不需 C 編譯器(CGo)或管理外部模型伺服器的情況下,直接將本地 AI 模型推論整合至應用程式中。它簡化了在各種硬體上本地執行大型語言模型(LLM)與視覺語言模型(VLM)的流程。

運作方式

此專案作為 llama.cpp 的 Go 包裝,利用 puregoffi 在同一行程中呼叫 llama.cpp 庫。這使得應用程式能利用硬體加速(如 CUDA、Metal 或 Vulkan)實現高效率,同時維持標準的 Go 建置流程。

適用對象

希望建構具備嵌入式本地 AI 功能的應用程式,避免容器或外部推論伺服器複雜性的 Go 開發者。

主要特色

  • 免 CGo 整合:使用 puregoffi,建置 Go 程式時無需 C 編譯器。
  • 廣泛的硬體支援:支援 Linux、macOS 與 Windows 上的 CUDA、Metal、Vulkan、HIP、ROCm、SYCL 與 OpenCL。
  • 本地推論:在與 Go 應用程式相同的行程中執行模型,以達成最大效能。
  • 多模態能力:支援使用 GGUF 格式模型的文本型 LLM 與視覺語言模型(VLM)。
  • 簡化模型管理:內建命令列工具,可直接從 Hugging Face 下載 GGUF 模型。

相關

  • 專案
  • 專案
  • 專案
  • Dispatch
  • 專案