zinggAI/zingg
Scalable master data management, identity resolution, entity resolution, and deduplication using ML
해결하는 문제
Zingg는 다양한 데이터 소스 간의 중복 레코드 문제를 해결합니다. 실제 데이터에서는 동일한 엔티티(예: 고객 또는 환자)가 정보의 미세한 차이로 인해 여러 번 나타나며, 이로 인해 분석 및 마스터 데이터 관리에 대한 단일 진실 소스를 구축하는 것이 어렵습니다.
작동 방식
Zingg는 머신러닝을 사용하여 엔티티 해결을 수행합니다. 대규모 데이터 처리를 위해 두 가지 주요 모델을 사용합니다.
- 블로킹 모델: 모든 레코드를 다른 모든 레코드와 비교하는 것은 계산 비용이 제곱적으로 증가하므로, Zingg는 유사한 레코드를 함께 인덱싱하는 클러스터링 모델을 학습하여 비교 횟수를 극적으로 줄입니다.
- 유사도 모델: 동일한 블록 내의 레코드 쌍이 일치하는지 예측하는 분류기로, 완전히 동일하지 않아도 일치 여부를 판단할 수 있습니다.
이러한 모델을 훈련하기 위해 Zingg는 작동 학습(Active Learning)을 활용하는 인터랙티브 러너를 포함하여 소규모 훈련 샘플에서 고정확도 모델을 구축합니다.
대상 사용자
이 도구는 데이터 사일로를 통합하고, 대규모 중복 제거를 수행하며, 여러 시스템 간에 비즈니스 엔티티에 대한 통합된 시각을 구축해야 하는 분석 엔지니어와 데이터 과학자에게 적합합니다.
주요 특징
- 액티브 러닝: 최소한의 라벨링 작업으로 정확한 모델을 생성할 수 있는 인터랙티브 훈련 데이터 빌더.
- 확장성: Apache Spark를 사용하여 수백만 개의 레코드까지 확장 가능한 자동 블로킹 모델 학습.
- 광범위한 연결성: Snowflake, S3, Azure 등의 클라우드 데이터 웨어하우스, NoSQL 데이터베이스, Cassandra, 주요 RDBMS와 연결 가능.
- 다국어 지원: 영어, 중국어, 태국어, 일본어, 힌디어의 기본 지원.
- 유연한 엔티티 처리: 고객, 환자, 공급업체, 제품 등 어떤 엔티티 유형도 처리 가능.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트