yifanfeng97/Hyper-Extract
Hypergraph is more powerful. Transform unstructured text into structured knowledge with LLMs. Graphs, hypergraphs, and spatio-temporal extractions — with one command.
解决的问题
Hyper-Extract 是一个 CLI 工具和框架,旨在将非结构化文本文档转换为结构化、强类型的「知识抽象」。它消除了手动阅读和整理信息的繁琐工作,能够自动将数据提取为从简单列表到复杂时空图等多种格式,使用户可以查询和可视化生成的知识库。
工作原理
该系统采用三层架构,包括 Auto-Types(8 种强类型数据结构)、Methods(如 GraphRAG 和 LightRAG 的提取算法)以及 Templates(80 多个领域特定预设)。它利用具备函数调用能力的 LLM(如 GPT-4o、Claude 和 DeepSeek)以及 OpenAI 兼容的嵌入模型,根据所选模板解析文档。提取的数据以持久化知识库的形式存储,随着新文档的加入可逐步演化。
适用人群
- 研究人员:需要将学术论文转化为交互式概念图的人。
- 金融分析师:希望从财报中提取实体和指标的人。
- 开发者:希望使用 vLLM 实现本地私有部署,将数据保留在本地的人。
- 知识管理者:使用 Obsidian 通过维基链接组织笔记的人。
核心亮点
- 多样化的知识结构:支持 8 种类型,包括超图和时空图。
- 丰富的模板库:提供 80 多个 YAML 模板,覆盖金融、法律、医疗等领域。
- 多模型支持:兼容 OpenAI、Anthropic、DeepSeek、阿里云以及本地 vLLM 部署。
- Obsidian 集成:可直接将提取的图导出至 Obsidian 仓库。
- MCP 服务器:向支持 MCP 的助手(如 Claude Desktop 和 IDE 代理)暴露知识抽象。
相关
- 项目
- 项目
- 项目
- 项目
- 项目