yifanfeng97/Hyper-Extract

Hypergraph is more powerful. Transform unstructured text into structured knowledge with LLMs. Graphs, hypergraphs, and spatio-temporal extractions — with one command.

解决的问题

Hyper-Extract 是一个 CLI 工具和框架,旨在将非结构化文本文档转换为结构化、强类型的「知识抽象」。它消除了手动阅读和整理信息的繁琐工作,能够自动将数据提取为从简单列表到复杂时空图等多种格式,使用户可以查询和可视化生成的知识库。

工作原理

该系统采用三层架构,包括 Auto-Types(8 种强类型数据结构)、Methods(如 GraphRAG 和 LightRAG 的提取算法)以及 Templates(80 多个领域特定预设)。它利用具备函数调用能力的 LLM(如 GPT-4o、Claude 和 DeepSeek)以及 OpenAI 兼容的嵌入模型,根据所选模板解析文档。提取的数据以持久化知识库的形式存储,随着新文档的加入可逐步演化。

适用人群

  • 研究人员:需要将学术论文转化为交互式概念图的人。
  • 金融分析师:希望从财报中提取实体和指标的人。
  • 开发者:希望使用 vLLM 实现本地私有部署,将数据保留在本地的人。
  • 知识管理者:使用 Obsidian 通过维基链接组织笔记的人。

核心亮点

  • 多样化的知识结构:支持 8 种类型,包括超图和时空图。
  • 丰富的模板库:提供 80 多个 YAML 模板,覆盖金融、法律、医疗等领域。
  • 多模型支持:兼容 OpenAI、Anthropic、DeepSeek、阿里云以及本地 vLLM 部署。
  • Obsidian 集成:可直接将提取的图导出至 Obsidian 仓库。
  • MCP 服务器:向支持 MCP 的助手(如 Claude Desktop 和 IDE 代理)暴露知识抽象。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目