harshankur/officeParser
A robust, strictly-typed Node.js and Browser library for parsing office files into a rich Abstract Syntax Tree (AST) and generating high-fidelity output in multiple formats. Parses: docx · pptx · xlsx · odt · odp · ods · pdf · rtf · csv · md · html. Generates: Markdown · HTML · CSV · RTF · PDF · Plain Text · RAG Chunks
解决的问题
officeParser 是一个通用文档解析器和生成器,旨在处理各种办公文件格式。它解决了从 DOCX、PDF、XLSX 等碎片化格式中提取结构化数据,并将其转换为统一的抽象语法树(AST)的问题,该 AST 可轻松转换为其他格式或用于 AI 流水线。
工作原理
该库将输入文件解析为丰富且分层的 AST。此 AST 作为中间表示,使库能够支持大量输入和输出格式。用户随后可以使用 OfficeGenerator 将此 AST 转换为特定输出,例如 Markdown、HTML 或纯文本。它还集成了 OCR 引擎(通过 Tesseract),用于从文档中的图像提取文本。
适用人群
- 开发者:构建文档处理流水线的人。
- AI/LLM 工程师:需要为 RAG(检索增强生成)流水线准备高保真数据的人。
- Web 开发者:创建将办公文档转换为网页就绪格式工具的人。
主要亮点
- 广泛格式支持:支持 12 种格式,包括 DOCX、PPTX、XLSX、PDF、ODT 和 EPUB。
- RAG 就绪分块:原生支持文档结构、固定大小和语义分块策略。
- 基于 AST 的架构:提供严格类型化的 AST,便于对文档内容进行深度检查和操作。
- 灵活输出:可生成 Markdown、HTML、CSV、RTF、PDF、EPUB 和纯文本。
- OCR 集成:内置 OCR 功能,用于扫描文档和图像中的文本提取。
- 跨平台:可在 Node.js 和浏览器中运行。
相关
- 项目
- 项目
- 项目
- 项目
- 项目