微調 olmOCR 以實現忠實的文件提取

TNG 開發了微調版的 olmOCR 模型,以自動化內部文件處理工作流程,特別針對關鍵頁首與頁尾資訊的遺漏問題。此修改將 olmOCR 從主要用於 LLM 訓練資料生成的工具,轉變為能夠捕捉所有文件文字的忠實 OCR 引擎,適用於商業應用。

基於管線的系統與原始 olmOCR 系統的限制

傳統的基於管線的 OCR 引擎依賴串接的機器學習元件來完成章節分割、表格解析與字符辨識。此方法的根本缺陷在於未能將上下文展平成邏輯閱讀順序(即線性化),這對於包含多欄文字、浮動圖示、頁首與頁尾的版面豐富文件尤為問題。

雖然 Vision Language Models(VLM)如 olmOCR 已解決線性化問題,但原始的 olmOCR-7B-0225-preview 是在 olmOCR-mix-0225 資料集上訓練的,該資料集刻意排除頁首與頁尾,以維持自然的閱讀流向以進行 next‑token 預測。因此,原始模型會忽略許多對商業使用情境(例如發票解析)而言關鍵的額外資訊。

微調流程與資料集產生

為了打造忠實的 OCR 引擎,TNG 使用 Qwen2.5-VL-72B-Instruct 產生了 8,000 份合成文件資料集,捕捉所有相關資訊,包括頁首與頁尾。

訓練設定

  • 基礎模型: olmOCR-7B-0225-preview
  • 硬體: 8xH100 Nvidia node
  • 訓練管線: 開源的 olmOCR 訓練管線
  • 超參數: 使用預設的超參數,並採用 4 次梯度累積步驟
  • 訓練時長: 2.5 個 epoch
  • 追蹤: 實驗追蹤透過 MLflow 進行

在評估方面,TNG 使用了客製化的 olmOCR-mix-0225 評估資料集,該資料集亦加入了由 Qwen2.5-VL-72B-Instruct 產生的頁首與頁尾資訊。

功能與效能比較

微調後的模型採用「文件錨定」提示策略,透過擷取原始文字區塊與位置資訊,將其與光柵化影像一起提示給 VLM,以保留數位原生內容。

質性評估顯示,微調模型在多個關鍵領域優於原始的 olmOCR-7B-0225-preview:

  • 頁首與頁尾抽取: 模型現在能抽取文件頂部與底部的關鍵資訊(例如發票),而原始模型則會忽略。
  • 版面保留: 模型仍能解析複雜的多欄版面與簡易表格。
  • 忠實度: 模型捕捉所有文字,包括先前被視為「額外」的資料,確保下游商業任務不會遺失關鍵資訊。

TNG 指出,輸出品質會因推論時使用的 temperature 設定而有顯著差異。

可用性

微調模型已開源,並可於 Hugging Face 取得,名稱為 tngtech/olmOCR-7B-faithful.

Sources