CannyLab/tsne-cuda

GPU Accelerated t-SNE for CUDA with Python bindings

解决的问题

t分布随机邻域嵌入(t-SNE)是一种用于在低维空间中可视化高维数据的流行技术,但其计算成本高且处理速度慢,对于非常大的数据集而言,标准实现可能难以承受。本项目解决了这一问题。

工作原理

本项目是 FIt-SNE 算法的优化 CUDA 实现。通过利用 GPU 加速,显著提升了嵌入计算的速度。它提供了 C++ 库和遵循 scikit-learn API 的 Python 包装器,便于使用。

适用人群

专为需要可视化超大规模高维数据集(最多可达 1000 万点)且要求处理速度远超 Sklearn 或 Multicore-TSNE 等 CPU 基础库的数据科学家和研究人员设计。

主要亮点

  • 极致加速:在兼容的 GPU 上,比 Sklearn 快最多 1200 倍,比 Multicore-TSNE 快 50 倍。
  • 高度可扩展:可处理从 1K 到 10M 点的数据集。
  • 熟悉 API:Python 包装器与 sklearn.manifold.TSNE 兼容。
  • 经验证的质量:生成的嵌入质量与其它最先进的实现相当。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目