jerryjliu/docjev
A very fast document classifier/splitter using Jev
解决的问题
DocJev 提供了一种基于自然语言规则自动分类文档并将大型 PDF 包拆分为独立文档的方法。它解决了手动整理多页文件(例如包含各种财务报告的合并 PDF)并识别文档起止点的问题,即使相邻文档属于同一类别也能处理。
运作方式
该系统使用 OCR 和决策引擎的流水线。它使用 LiteParse(本地)或 LlamaParse(针对复杂版面的云端 OCR)从 PDF、DOCX 或 PPTX 文件中提取文本。这些文本随后会被发送到 Jev 决策引擎(托管服务),该引擎应用自然语言类别规则来预测文档的类别或页面之间的边界。此过程是页面级别且连续的,这意味着它会识别每个区段的页面范围。
目标用户
它专为需要处理大量非结构化文档包的用户和开发人员而设计,特别是在金融、政府或法律领域,这些领域的税务表格、新闻稿和财务报告等文件通常会被捆绑在一起。
特色亮点
- 多格式支持: 处理 PDF、DOCX 和 PPTX 文件。
- 灵活的规则: 使用基于 YAML 的自然语言描述来定义类别和拆分逻辑。
- 混合 OCR: 提供通过 LiteParse 进行的本地解析,以及通过 LlamaParse 进行的可选云端 OCR。
- 审核标记: 自动标记不确定的边界或类别冲突,以供人工审核。
- 性能基准: 包含与 GPT-5.6 Luna 等其他模型相比的决策延迟和准确度的详细比较。
相关
- 项目
- 项目
- 项目
- 项目