sapientml/sapientml

Generative AutoML for Tabular Data

해결하는 문제

SapientML은 자동 기계 학습(AutoML)에서 "탐색 공간 폭발" 문제를 해결합니다. 기존 AutoML 도구는 대규모이고 복잡한 표 형식 데이터셋을 다룰 때, ML 구성 요소의 가능한 조합 수가 너무 많아 효율적으로 탐색할 수 없기 때문에 최적의 파이프라인을 찾지 못하거나 완전히 실패하는 경우가 많습니다.

작동 방식

SapientML은 Kaggle과 같은 소스에서 채굴한 기존 데이터셋과 인간이 작성한 솔루션의 코퍼스에서 학습하여 기계 학습 파이프라인을 생성적으로 합성합니다. 3단계 분할 정복 프로그램 합성 전략을 사용합니다:

  1. 메타학습: 특정 작업에 적합한 타당한 ML 구성 요소 집합을 예측합니다.
  2. 파이프라인 정밀화: 파이프라인 데이터플로우 모델을 사용해 이러한 구성 요소를 소수의 실행 가능한 구체적인 파이프라인으로 좁힙니다.
  3. 동적 평가: 남은 파이프라인을 평가하여 가장 성능이 우수한 솔루션을 선택합니다.

대상 사용자

표 형식 데이터(분류 및 회귀)에 대해 수동으로 전체 워크플로우를 설계하지 않고도 고품질 예측 파이프라인을 생성해야 하는 데이터 과학자 및 개발자에게 적합합니다.

주요 특징

  • 생성형 코드: 일부 AutoML 도구가 모델 객체만 제공하는 반면, SapientML은 파이프라인을 구축하는 데 실제로 사용되는 Python 코드를 생성할 수 있으며, 저장 및 재사용이 가능합니다.
  • 인간 중심 학습: 170개 데이터셋에 걸쳐 1,094개의 인간이 작성한 파이프라인으로 구성된 대규모 코퍼스에서 학습합니다.
  • 강건성: 다른 AutoML 도구가 파이프라인을 생성하지 못하는 대규모 실세계 데이터셋에서도 작동하도록 특별히 설계되었습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트