harshankur/officeParser

A robust, strictly-typed Node.js and Browser library for parsing office files into a rich Abstract Syntax Tree (AST) and generating high-fidelity output in multiple formats. Parses: docx · pptx · xlsx · odt · odp · ods · pdf · rtf · csv · md · html. Generates: Markdown · HTML · CSV · RTF · PDF · Plain Text · RAG Chunks

解決的問題

officeParser 是一個通用文件解析器與產生器,專為處理多種辦公室文件格式而設計。它解決了從 DOCX、PDF、XLSX 等碎片化格式中提取結構化資料,並轉換為統一的抽象語法樹(AST)的問題,此 AST 可輕鬆轉換為其他格式或用於 AI 流程中。

如何運作

該程式庫將輸入檔案解析為豐富且階層化的 AST。此 AST 作為中間表示,讓程式庫能支援廣泛的輸入與輸出格式。使用者可使用 OfficeGenerator 將此 AST 轉換為特定輸出,例如 Markdown、HTML 或純文字。同時也內建 OCR 引擎(透過 Tesseract),可從文件中的圖片提取文字。

適用對象

  • 開發者:建構文件處理流程的人。
  • AI/LLM 工程師:需要為 RAG(檢索增強生成)流程準備高保真資料的人。
  • Web 開發者:開發將辦公文件轉換為網頁就緒格式工具的人。

主要特色

  • 廣泛格式支援:支援 12 種格式,包括 DOCX、PPTX、XLSX、PDF、ODT 和 EPUB。
  • RAG 就緒分塊:原生支援文件結構、固定大小與語意分塊策略。
  • 基於 AST 的架構:提供嚴格類型化的 AST,便於深入檢視與操作文件內容。
  • 彈性輸出:可產生 Markdown、HTML、CSV、RTF、PDF、EPUB 與純文字。
  • OCR 整合:內建 OCR 功能,可用於掃描文件與圖片中的文字提取。
  • 跨平台:可在 Node.js 與瀏覽器中運作。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案