zinggAI/zingg

Scalable master data management, identity resolution, entity resolution, and deduplication using ML

解决的问题

Zingg 解决了跨不同数据源的重复记录问题。在真实数据中,同一实体(如客户或患者)通常会以信息上的微小差异多次出现,这使得构建分析和主数据管理的单一真实来源变得困难。

工作原理

Zingg 使用机器学习进行实体解析。它采用两种主要模型来处理大规模数据:

  1. 阻断模型:为了避免将每条记录与每条其他记录进行比较(这将导致计算成本呈二次增长),Zingg 学习一种聚类模型,将相似记录分组索引,从而大幅减少所需的比较次数。
  2. 相似度模型:一种分类器,能够预测同一区块内的记录对是否匹配,即使它们并不完全相同。

为了训练这些模型,Zingg 内置了一个交互式学习器,利用主动学习从少量训练样本中构建高精度模型。

适用人群

该工具专为需要整合数据孤岛、执行大规模去重,并在多个系统间建立统一业务实体视图的分析工程师和数据科学家设计。

主要亮点

  • 主动学习:交互式训练数据构建器,仅需少量标注即可创建高精度模型。
  • 可扩展性:自动学习阻断模型,可利用 Apache Spark 扩展至数百万条记录。
  • 广泛连接性:支持连接多种云数据仓库(Snowflake、S3、Azure)、NoSQL 数据库、Cassandra 以及主流 RDBMS。
  • 多语言支持:开箱即用支持英语、中文、泰语、日语和印地语。
  • 灵活的实体处理:可处理任意实体类型,如客户、患者、供应商或产品。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目