zinggAI/zingg
Scalable master data management, identity resolution, entity resolution, and deduplication using ML
解決的問題
Zingg 解決了跨不同資料來源的重複記錄問題。在真實資料中,同一實體(例如客戶或病患)通常會以資訊上的微小差異多次出現,這使得建立分析與主資料管理的單一真實來源變得困難。
工作原理
Zingg 使用機器學習進行實體解析。它採用兩種主要模型來處理大規模資料:
- 阻斷模型:為避免將每筆記錄與其他每筆記錄進行比較(這將導致計算成本呈二次增長),Zingg 學習一種聚類模型,將相似記錄分組索引,從而大幅減少所需的比較次數。
- 相似度模型:一種分類器,能夠預測同一區塊內的記錄對是否匹配,即使它們並不完全相同。
為了訓練這些模型,Zingg 內建了一個互動式學習器,利用主動學習從少量訓練樣本中建立高精度模型。
適用對象
該工具專為需要整合資料孤島、執行大規模去重,並在多個系統間建立統一業務實體視圖的分析工程師與資料科學家設計。
主要亮點
- 主動學習:互動式訓練資料建構器,僅需少量標註即可建立高精度模型。
- 可擴展性:自動學習阻斷模型,可利用 Apache Spark 擴展至數百萬筆記錄。
- 廣泛連接性:支援連接多種雲端資料倉儲(Snowflake、S3、Azure)、NoSQL 資料庫、Cassandra 以及主流 RDBMS。
- 多語言支援:開箱即用支援英文、中文、泰文、日文與印地文。
- 靈活的實體處理:可處理任意實體類型,如客戶、病患、供應商或產品。
相關
- 專案
- 專案
- 專案
- 專案
- 專案