DharmaOCR: 巴西葡萄牙語 OCR 的專業化優勢

DharmaOCR: 巴西葡萄牙語 OCR 的專業化優勢

DharmaOCR 透過針對單一領域的目標微調和直接偏好優化(DPO),將所有模型參數集中在巴西葡萄牙語文件上,因而優於較新的通用模型,如 Mistral OCR4 和 Unlimited-OCR。

領域專業化 vs. 多語言廣度

專業化相較於通用模型提供結構性優勢,因為它優化了有限模型參數的分配。多語言模型必須將其表示容量分配到 N 種語言上,而像 DharmaOCR 這樣的專業模型則將所有參數專注於單一目標語言的特定詞彙、形態學和正寫模式。

這種資源集中使模型能夠捕捉通用模型常遺漏的語言細節。例如,在使用 ENEM 作文(巴西國家高中考試)的基準測試中,通用模型無法正確轉錄巴西 nationally recognised 的人物和短語,如「Chico Buarque」,而 DharmaOCR 則正確處理了它們。這表明通用模型的失誤並非隨機,而是特別出現在區分特定語言與更廣泛多語言語料庫的詞彙和專有名詞上。

效能基準

模型 抽取品質分數
DharmaOCR 0.925
Mistral OCR4 0.798
Unlimited-OCR 0.7587

DharmaOCR 在 Mistral OCR4 上領先約 13 分,在 Unlimited-OCR 上領先超過 16 分,證明即使面對較新的架構進步,領域專業化仍然有效。

透過 DPO 解決文本退化

文本退化——模型產生重複、不連貫或語義斷裂的輸出——是生產 OCR 中的一個關鍵失敗模式,通常由視覺歧義觸發,例如小字體或掃描品質下降。

DharmaOCR 透過兩階段訓練管道緩解此問題:

  1. 監督微調 (SFT): 此階段透過將模型權重與巴西葡萄牙語的詞彙和文件結構對齊來建立領域能力。
  2. 直接偏好優化 (DPO): 與 SFT 逐步預測 token 不同,DPO 根據完整輸出的品質來訓練模型。透過基於完整提取的一致性來教導模型區分競爭回應,DPO 抑制導致退化的漂移和重複迴圈。

此方法確保模型在通用模型(如 Mistral OCR4)可能產生與來源文件完全脫節的輸出的條件下仍保持穩定。

專業化的結構邏輯

雖然較新的架構和擴充的資料集可能提升所有模型的絕對效能上限,但專業化的相對優勢仍然存在。結構動態保持不變:將所有資源導向單一領域的系統,在該領域內能從這些資源中提取更多價值,相較於將資源分散到多個領域的系統。

DharmaOCR 的策略是將新興前沿技術——包括新架構和對齊方法——專門應用於巴西葡萄牙語 OCR 的固定領域,以在最低可能的成本和推理時間下維持最高可能的提取品質。

Sources