harshankur/officeParser
A robust, strictly-typed Node.js and Browser library for parsing office files into a rich Abstract Syntax Tree (AST) and generating high-fidelity output in multiple formats. Parses: docx · pptx · xlsx · odt · odp · ods · pdf · rtf · csv · md · html. Generates: Markdown · HTML · CSV · RTF · PDF · Plain Text · RAG Chunks
解決的問題
officeParser 是一個通用文件解析器與產生器,專為處理多種辦公室文件格式而設計。它解決了從 DOCX、PDF、XLSX 等碎片化格式中提取結構化資料,並轉換為統一的抽象語法樹(AST)的問題,此 AST 可輕鬆轉換為其他格式或用於 AI 流程中。
如何運作
該程式庫將輸入檔案解析為豐富且階層化的 AST。此 AST 作為中間表示,讓程式庫能支援廣泛的輸入與輸出格式。使用者可使用 OfficeGenerator 將此 AST 轉換為特定輸出,例如 Markdown、HTML 或純文字。同時也內建 OCR 引擎(透過 Tesseract),可從文件中的圖片提取文字。
適用對象
- 開發者:建構文件處理流程的人。
- AI/LLM 工程師:需要為 RAG(檢索增強生成)流程準備高保真資料的人。
- Web 開發者:開發將辦公文件轉換為網頁就緒格式工具的人。
主要特色
- 廣泛格式支援:支援 12 種格式,包括 DOCX、PPTX、XLSX、PDF、ODT 和 EPUB。
- RAG 就緒分塊:原生支援文件結構、固定大小與語意分塊策略。
- 基於 AST 的架構:提供嚴格類型化的 AST,便於深入檢視與操作文件內容。
- 彈性輸出:可產生 Markdown、HTML、CSV、RTF、PDF、EPUB 與純文字。
- OCR 整合:內建 OCR 功能,可用於掃描文件與圖片中的文字提取。
- 跨平台:可在 Node.js 與瀏覽器中運作。
相關
- 專案
- 專案
- 專案
- 專案
- 專案