AuvaLab/itext2kg

We build KGs the way nature builds matter

解决的问题

本项目提供了一套工具,用于从非结构化文本中构建和分析知识图谱(KG),特别针对时间动态性、事实完备性以及传统静态KG常遗漏的“弱信号”(罕见但正在出现的模式)检测等挑战。

工作原理

该仓库集成了三个主要框架:

  • ATOM:用于构建时间知识图谱(TKG)的可扩展流水线。它将文本分解为最小的“原子事实”,以防止LLM遗漏信息,采用并行方式提取5元组(主语、谓语、宾语、开始时间、结束时间),并通过余弦相似度进行实体和关系消歧,而非依赖缓慢的LLM调用,将这些信息合并为全局图谱。
  • iText2KG:支持静态和动态图谱的增量式KG构建框架,具有异步架构,可高效处理LLM API调用。
  • C-Unseen:用于动态图谱中“弱信号”检测的系统。它使用基于LLM链式思维的稀有子图提取器,找出与主流叙事相矛盾的子图,并通过弱信号警报器追踪这些模式是否随时间持续或扩大。

适用人群

专为从时效性数据(如新闻档案或医疗记录)构建知识库的研究人员和开发者设计,需要高事实覆盖率、可扩展性以及检测新兴趋势的能力。

主要亮点

  • 并行架构:ATOM通过并行提取和非LLM依赖的合并,相比类似框架将延迟降低超过90%。
  • 双重时间建模:同时追踪事实被观察到的时间和其实际有效的时间,防止时间误标。
  • 原子分解:将长文本拆分为小片段,使事实完备性提升约31%。
  • 自解释性:C-Unseen将稀有和弱信号标签直接写回图谱,便于直观检查。

相关

  • 项目
  • 项目
  • 项目
  • 项目