NVIDIA/cuml
NVIDIA cuML: GPU-Accelerated Machine Learning
解决的问题
cuML 旨在克服基于 CPU 的机器学习性能瓶颈。它允许用户在 NVIDIA GPU 上运行机器学习工作负载,从而在某些基准测试中实现比 scikit-learn 快达 50 倍的显著加速。
工作原理
该库提供了两种主要的 GPU 加速方法:
- GPU 原生 API:一个
cumlPython API,采用 scikit-learn 风格的fit-predict-transform模式,确保数据和计算完全在 GPU 上进行。 - 透明加速:
cuml.accel模块允许用户在不修改其 Python 代码的情况下加速现有的 scikit-learn、UMAP 和 HDBSCAN 代码,当某个操作无法加速时会自动回退到 CPU。
对于更大的数据集,cuml.dask API 可通过 Dask 实现跨多个 GPU 和多节点集群的分布式执行。
适用人群
使用 scikit-learn 并需要将机器学习工作流扩展到更大数据集,或利用 NVIDIA GPU 缩短训练和推理时间的数据科学家和机器学习工程师。
主要亮点
- 与 scikit-learn 兼容:使用熟悉的 API,兼容 scikit-learn 1.6 及以上版本。
- 高性能:在代表性基准测试中,工作流加速最高可达 50 倍。
- 零代码变更加速:
cuml.accel可在不修改源代码的情况下为现有脚本启用 GPU 加速。 - 多 GPU 扩展:通过
cuml.dask支持分布式机器学习。 - 广泛的算法支持:涵盖聚类、降维、回归、分类、预处理和时间序列分析。
相关
- 项目
- 项目
- 项目
- 项目
- 项目