jerryjliu/docjev

A very fast document classifier/splitter using Jev

解决的问题

DocJev 提供了一种基于自然语言规则自动分类文档并将大型 PDF 包拆分为独立文档的方法。它解决了手动整理多页文件(例如包含各种财务报告的合并 PDF)并识别文档起止点的问题,即使相邻文档属于同一类别也能处理。

运作方式

该系统使用 OCR 和决策引擎的流水线。它使用 LiteParse(本地)或 LlamaParse(针对复杂版面的云端 OCR)从 PDF、DOCX 或 PPTX 文件中提取文本。这些文本随后会被发送到 Jev 决策引擎(托管服务),该引擎应用自然语言类别规则来预测文档的类别或页面之间的边界。此过程是页面级别且连续的,这意味着它会识别每个区段的页面范围。

目标用户

它专为需要处理大量非结构化文档包的用户和开发人员而设计,特别是在金融、政府或法律领域,这些领域的税务表格、新闻稿和财务报告等文件通常会被捆绑在一起。

特色亮点

  • 多格式支持: 处理 PDF、DOCX 和 PPTX 文件。
  • 灵活的规则: 使用基于 YAML 的自然语言描述来定义类别和拆分逻辑。
  • 混合 OCR: 提供通过 LiteParse 进行的本地解析,以及通过 LlamaParse 进行的可选云端 OCR。
  • 审核标记: 自动标记不确定的边界或类别冲突,以供人工审核。
  • 性能基准: 包含与 GPT-5.6 Luna 等其他模型相比的决策延迟和准确度的详细比较。

相关

  • 项目
  • 项目
  • 项目
  • 项目