sapientml/sapientml
Generative AutoML for Tabular Data
解决的问题
SapientML 解决了自动化机器学习(AutoML)中的「搜索空间爆炸」问题。传统 AutoML 工具在处理大型、复杂的表格数据集时,常常难以找到最优的流水线,甚至完全失败,因为机器学习组件的可能组合数量过于庞大,无法高效搜索。
工作原理
SapientML 通过从现有数据集和人类编写的解决方案(从 Kaggle 等来源挖掘)的语料库中学习,采用生成式方法合成机器学习流水线。它采用三阶段分而治之的程序合成策略:
- 元学习:预测特定任务下一组合理的机器学习组件。
- 流水线优化:使用流水线数据流模型,将这些组件缩小为少量可行的具体流水线。
- 动态评估:评估剩余的流水线,选择性能最佳的解决方案。
适用人群
专为需要为表格数据(分类和回归)生成高质量预测流水线,但无需手动设计整个工作流的数据科学家和开发者而设计。
主要亮点
- 生成式代码:与某些 AutoML 工具仅提供模型对象不同,SapientML 可以生成实际用于构建流水线的 Python 代码,可保存并重复使用。
- 人类启发式:从 170 个数据集上的 1,094 个由人类编写的流水线中学习。
- 鲁棒性:特别设计用于处理大型真实世界数据集,其他 AutoML 工具可能无法生成流水线的情况。
相关
- 项目
- 项目
- 项目
- 项目
- 项目