upgini/upgini

Data search & enrichment library for Machine Learning → Easily find and add relevant features to your ML & AI pipeline from hundreds of public and premium external data sources, including open & commercial LLMs

解決的問題

Upgini 是一個低程式碼庫,旨在解決將外部資料與特徵手動尋找並整合至機器學習管道中耗時的過程。它旨在以自動化系統取代手動資料處理與假設測試,該系統僅識別真正提升模型準確率的特徵,而非僅與目標變數相關的特徵。

工作原理

Upgini 作為一個智慧型資料搜尋引擎運作。它可連接數百個公開、社群共享與付費的外部資料來源。透過結合大型語言模型(LLMs)、圖神經網路(GNNs)與循環神經網路(RNNs),自動產生並優化最佳的機器學習特徵集。它也能擴展搜尋鍵(如郵遞區號或IP位址),以擴大在可用來源中的搜尋範圍,並提供與 Scikit-learn 相容的介面,可無縫整合至現有管道中。

適用對象

專為處理表格資料的監督式學習任務(包括二元/多類別分類、迴歸與時間序列預測)的資料科學家與機器學習工程師設計。

主要亮點

  • 自動特徵發現:找到能為特定目標模型帶來準確率提升的特徵。
  • 多源整合:可存取涵蓋239個國家的公開、社群共享與付費資料提供者。
  • 搜尋鍵增強:自動補齊遺漏的搜尋鍵,以最大化資料取得。
  • 穩定性驗證:於時間外區間與驗證資料集上檢查準確率提升,以降低依賴風險。
  • 低程式碼介面:提供與 Scikit-learn 相容的 Python 套件與拖曳式搜尋 UI。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案