dmlc/xgboost

Scalable, Portable and Distributed Gradient Boosting (GBDT, GBRT or GBM) Library, for Python, R, Java, Scala, C and more. Runs on single machine, Hadoop, Spark, Dask, Flink and DataFlow

解决的问题

XGBoost 解决了使用梯度提升方法快速、准确且可扩展地解决数据科学问题的需求。它提供了一个系统,能够处理海量数据集(可能超过数十亿个样本),同时在不同计算环境中保持高效和可移植性。

工作原理

XGBoost 在梯度提升框架内实现机器学习算法,特别是提供并行树提升(也称为 GBDT 或 GBM)。这种方法使该库能够分布在 Kubernetes、Hadoop、SGE、Dask、Spark 和 PySpark 等各种环境中。

适用人群

专为需要在大规模数据上训练模型,并且在部署环境中需要高性能和灵活性的数据科学家和机器学习工程师设计。

主要亮点

  • 并行树提升,实现快速且准确的结果。
  • 支持 Kubernetes、Hadoop、SGE、Dask、Spark 和 PySpark 的分布式计算。
  • 可处理包含数十亿个样本的数据集。
  • 针对效率、灵活性和可移植性进行了优化。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目