upgini/upgini

Data search & enrichment library for Machine Learning → Easily find and add relevant features to your ML & AI pipeline from hundreds of public and premium external data sources, including open & commercial LLMs

해결하는 문제

Upgini는 기계학습 파이프라인에 외부 데이터와 특징을 수동으로 찾고 통합하는 시간이 오래 걸리는 과정을 해결하기 위한 저코드 라이브러리입니다. 타겟 변수와 상관관계가 있는 특징이 아니라 실제로 모델의 정확도를 향상시키는 특징만 자동으로 식별하는 자동화된 시스템으로, 수동 데이터 조작과 가설 검증을 대체합니다.

작동 방식

Upgini는 지능형 데이터 검색 엔진으로 작동합니다. 수백 개의 공개, 커뮤니티, 프리미엄 외부 데이터 소스에 연결할 수 있습니다. 대규모 언어 모델(LLMs), 그래프 신경망(GNNs), 순환 신경망(RNNs)을 결합하여 최적의 기계학습 특징 세트를 자동으로 생성하고 최적화합니다. 또한 우편번호나 IP 주소와 같은 검색 키를 확장하여 이용 가능한 소스 전체에 걸쳐 검색 범위를 넓힐 수 있으며, 기존 파이프라인에 원활하게 통합할 수 있는 Scikit-learn 호환 인터페이스를 제공합니다.

대상 사용자

이 라이브러리는 이진/다중 클래스 분류, 회귀, 시계열 예측과 같은 지도 학습 작업에서 표형 데이터를 다루는 데이터 과학자 및 ML 엔지니어를 위한 것입니다.

주요 특징

  • 자동 특징 탐색: 타겟 모델의 정확도 향상에 직접 기여하는 특징을 찾습니다.
  • 다중 소스 통합: 239개 국가에 걸쳐 공개, 커뮤니티 공유, 프리미엄 데이터 제공업체에 접근 가능합니다.
  • 검색 키 확장: 누락된 검색 키를 자동으로 보완하여 데이터 검색을 최대화합니다.
  • 안정성 검증: 시간 외 간격과 검증 데이터셋에서 정확도 향상을 확인하여 의존성 리스크를 완화합니다.
  • 저코드 인터페이스: Scikit-learn 호환 Python 라이브러리와 드래그 앤 드롭 검색 UI를 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트