run-llama/liteparse
A fast, helpful, and open-source document parser
LiteParse – 適用於 LLM 友好型流程的快速本地 PDF 解析器
是什麼 – LiteParse 是一個開源程式庫,可完全在裝置上從 PDF 類文件中提取文字、版面、圖片和向量圖形。它以 Rust 核心為基礎,使用 PDFium 進行文字提取,使用 Tesseract(或任何 HTTP 基礎 OCR)進行影像文字提取。專案提供 Rust、Python、Node/TypeScript 和 WebAssembly 的語言綁定,以及一個小型 CLI(lit),無論透過何種方式安裝,其行為皆一致。
對 AI 為何重要 – 基於 LLM 的檢索增強生成(RAG)與代理工作流程需要乾淨、結構化的文件資料。LiteParse 可產生:
- Markdown:包含重構的標題、表格、清單與圖片佔位符,可直接輸入 LLM。
- JSON:包含原始文字、精確的邊界框、可選的圖片元資料、向量圖形路徑、PDF 結構樹與表單欄位。
- 截圖(PNG):捕捉頁面的視覺外觀,對視覺增強代理非常有用。 所有操作皆在本地執行,因此可避免雲端服務成本、延遲與資料隱私問題。
核心功能
- 快速且輕量 – 基於 PDFium 的文字提取速度快;OCR 為可選,可替換為任何 HTTP OCR 服務。
- 選擇性 OCR – 低成本的「複雜度檢查」(
lit is-complex)可提前判斷文件是否需要 OCR,避免不必要的重負載。 - 多格式輸入 – PDF、DOCX、XLSX、PPTX 與影像會先透過 LibreOffice + Rust 圖像套件轉換為 PDF 類似表示,以實現統一處理。
- 豐富輸出選項 – 可選擇純文字、Markdown 或結構化 JSON;可選啟用圖片提取、向量圖形、PDF 結構樹、版面區塊、註解、表單欄位、文件元資料、內容邊界、XFA 資料包等。
- 跨平台 – 支援 Linux、macOS(Intel/ARM)與 Windows;也提供瀏覽器用的 WASM 套件。
- 代理技能整合 – 可透過
skillsCLI 安裝為 LLM 代理技能,使代理可隨時呼叫liteparse。
安裝(選擇你的語言/執行環境)
| 語言 | 命令 | 文件 |
|---|---|---|
| Rust (CLI) | cargo install liteparse |
crates.io README |
| Python | pip install liteparse |
Python README |
| Node/TypeScript | npm i -g @llamaindex/liteparse |
Node README |
| 瀏覽器 (WASM) | npm i @llamaindex/liteparse-wasm |
WASM README |
典型 CLI 工作流程
# 基礎文字提取
lit parse report.pdf
# Markdown 輸出(非常適合 LLM 提示)
lit parse report.pdf --format markdown -o report.md
# 包含邊界框與圖片的 JSON
lit parse report.pdf --format json --extract-images -o report.json
# 快速檢查是否需要 OCR
lit is-complex report.pdf && lit parse report.pdf --no-ocr
# 批次處理資料夾
lit batch-parse ./in ./out --format markdown
# 為視覺代理生成頁面截圖
lit screenshot report.pdf -o ./screenshots --dpi 300
作為程式庫使用(Python 範例)
from liteparse import LiteParse
parser = LiteParse(ocr=False) # 禁用 OCR 以提升速度
result = parser.parse_path('report.pdf')
print(result.json()) # 包含邊界框的結構化輸出
(Rust、Node 與 WASM 中也有等效 API。)
何時使用雲端版本 – 對於極其複雜的 PDF(密集表格、多欄版面、掃描文件、手寫筆記),作者推薦其雲端服務 LlamaParse,該服務提供重型 AI 驅動的版面重建。當需要速度、隱私或離線運作時,LiteParse 仍是首選。
誰會受益
- 建構 RAG 流程並需要快速、決定性預處理的開發者。
- 需要頁面截圖或精確文字坐標的 LLM 代理平台。
- 無法將文件傳送至外部服務的資料隱私受限企業。
- 無需重型 ML 堆疊即可獲得輕量級、跨語言 PDF 解析器的任何人。
TL;DR – LiteParse 是一個快速、本地執行的 PDF(及辦公文件)解析器,可輸出 Markdown、帶邊界框的 JSON、圖片與向量圖形,並可透過 Rust、Python、Node 或瀏覽器呼叫。專為需要結構化文件資料但無雲端依賴的 AI/RAG 工作流程設計。
相關
- 專案
- 專案
- 專案
- 專案
- 專案