Bergvca/string_grouper

Super Fast String Matching in Python

解決的問題

簡化並加速在一個或多個列表中尋找並分組相似字串的過程。這對於需要對存在微小差異(模糊比對)但代表同一實體的大規模資料集進行去重時特別有用。

工作原理

該庫使用 tf-idf 計算字串之間的餘弦相似度。為了在大型資料集上實現高效率,它利用基於 Rust 的稀疏矩陣乘法後端(sp_matmul_rs),能在數秒內處理數十萬筆字串。

適用對象

需要對大型文字資料集進行高效模糊比對與字串去重的資料科學家與開發者。

主要特色

  • 高速性能:在消費級硬體上,可在 18 秒內完成 663,000 個姓名的模糊比對。
  • 基於圖的分組:能夠解析字串之間的間接關聯,形成一致的分組。
  • 中心點識別:為每個分組確定一個代表性的「中心點」字串。
  • 靈活的後端支援:同時支援現代 Rust 實作與原始的 sparse_dot_topn 後端。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案