moj-analytical-services/splink
Fast, accurate and scalable probabilistic data linkage with support for multiple SQL backends
解决的问题
Splink 专为在缺乏唯一标识符的数据集中进行记录去重和链接而设计。它解决了实体解析问题——当您只有跨多个列的不完整或不一致数据时,如何识别两个记录是否指向同一个现实世界实体(如个人或公司)。
工作原理
Splink 使用基于 Fellegi-Sunter 模型的概率记录链接算法。它根据多个不相关的列(例如姓名、出生日期、城市)预测记录对之间的匹配概率。系统可以使用无监督学习(期望最大化)来估计模型参数,这意味着无需预先标记的训练数据。一旦计算出匹配概率,系统会将这些链接聚类,为每组重复记录分配一个唯一 ID。
适用人群
该工具适用于政府、学术界和私营部门的数据科学家和分析师,尤其适合需要大规模执行记录链接的场景,特别是处理数百万条记录时。
主要亮点
- 高性能:可在笔记本电脑上约一分钟内链接一百万条记录。
- 可扩展性:支持多种后端,包括本地 Python 执行的 DuckDB,以及超过一亿条记录的数据集所用的 Spark 或 PostgreSQL。
- 无监督学习:无需训练数据即可训练模型。
- 交互式诊断:包含一系列交互式可视化工具,帮助用户诊断和优化其链接模型。
- 模糊匹配:支持词频调整和用户自定义的模糊匹配逻辑,以提高准确性。
相关
- 项目
- 项目
- 项目
- 项目
- 项目