ggml-org/ggml

Tensor library for machine learning

解决的问题

提供一种简单、可移植且高效的机器学习张量处理方式,无需在实现 ML 模型时进行复杂的设置或依赖重型依赖项。

工作原理

该库使用纯 C/C++ 编写,为多种架构(x86、ARM、RISC-V)实现 SIMD 优化内核,并支持广泛的后端,包括 CPU、GPU、NPU 和 Web 浏览器。它利用 2 至 8 位整数量化和微缩放格式(MXFP4 和 NVFP4)来减小模型大小和内存使用量,同时确保运行时零内存分配,以实现最大效率。

适用人群

需要一个轻量级、跨平台的机器学习张量库,可在从高端硬件到 WebAssembly 的各种环境中运行的开发者。

主要亮点

  • 广泛的跨平台支持(x86、ARM、RISC-V、LoongArch、PowerPC、s390x 和 WebAssembly)。
  • 运行时零内存分配。
  • 支持 2 至 8 位整数量化。
  • 无外部依赖。

相关

  • Dispatch
  • 项目
  • 项目
  • 项目
  • 项目