upgini/upgini
Data search & enrichment library for Machine Learning → Easily find and add relevant features to your ML & AI pipeline from hundreds of public and premium external data sources, including open & commercial LLMs
解决的问题
Upgini 是一个低代码库,旨在解决将外部数据和特征手动查找并集成到机器学习管道中的耗时过程。它旨在用自动化系统替代手动数据处理和假设测试,该系统仅识别那些真正提升模型准确率的特征,而不仅仅是与目标变量相关的特征。
工作原理
Upgini 作为一个智能数据搜索引擎运行。它可连接数百个公开、社区共享和付费的外部数据源。通过结合大型语言模型(LLMs)、图神经网络(GNNs)和循环神经网络(RNNs),它能自动生成并优化最优的机器学习特征集。它还能扩展搜索键(如邮政编码或IP地址),以扩大在可用数据源中的搜索范围,并提供与 Scikit-learn 兼容的接口,可无缝集成到现有管道中。
适用人群
专为处理表格数据的监督学习任务(包括二分类/多分类、回归和时间序列预测)的数据科学家和机器学习工程师设计。
主要亮点
- 自动特征发现:找到能为特定目标模型带来准确率提升的特征。
- 多源集成:可访问覆盖239个国家的公开、社区共享和付费数据提供商。
- 搜索键增强:自动补全缺失的搜索键,以最大化数据获取。
- 稳定性验证:在时间外区间和验证数据集上检查准确率提升,以降低依赖风险。
- 低代码接口:提供与 Scikit-learn 兼容的 Python 库和拖拽式搜索 UI。
相关
- 项目
- 项目
- 项目
- 项目
- 项目