zinggAI/zingg
Scalable master data management, identity resolution, entity resolution, and deduplication using ML
何を解決するか
Zinggは、異なるデータソース間で重複するレコードの問題を解決します。現実のデータでは、同じエンティティ(例:顧客や患者)が情報のわずかな違いで複数回出現することが多く、分析やマスターデータ管理における単一の真実のソースを構築することが困難になります。
動作方法
Zinggは機械学習を用いてエンティティ解決を実行します。大規模なデータ処理に対応するため、2つの主要なモデルを採用しています。
- ブロッキングモデル:すべてのレコード同士を比較する(計算量が二次的に増加する)ことを避けるために、Zinggは類似したレコードをグループ化するクラスタリングモデルを学習し、比較回数を大幅に削減します。
- 類似度モデル:同じブロック内のレコードペアが一致するかどうかを予測する分類器であり、完全に同一でなくても一致を判定できます。
これらのモデルを訓練するため、Zinggはアクティブラーニングを活用したインタラクティブなラーナーを内蔵しており、小さなトレーニングサンプルから高精度なモデルを構築できます。
対象ユーザー
このツールは、データスイロを統合し、大規模な重複除去を行い、複数システム間でビジネスエンティティの統一ビューを構築する必要がある分析エンジニアやデータサイエンティスト向けに設計されています。
特徴
- アクティブラーニング:最小限のラベル付け作業で高精度なモデルを構築できるインタラクティブなトレーニングデータビルダー。
- スケーラビリティ:Apache Sparkを活用し、数百万レコードにまでスケーラブルな自動ブロッキングモデル学習を実現。
- 広範な接続性:Snowflake、S3、Azureなどのクラウドデータウェアハウス、NoSQLデータベース、Cassandra、主要なRDBMSに対応。
- 多言語対応:英語、中国語、タイ語、日本語、ヒンディー語のオールインワンサポート。
- エンティティの柔軟性:顧客、患者、サプライヤー、製品など、任意のエンティティタイプを扱える。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト