Docmatix 資料集發布
Hugging Face 已發布 Docmatix,這是一個大型的文件視覺問答(DocVQA)資料集,旨在縮小開源與專有視覺語言模型(VLM)之間的效能差距。對 Florence-2 模型在 Docmatix 的小部分進行微調,使其在 DocVQA 基準測試上的相對效能提升了近 20%。
資料集規模與組成
與先前的 DocVQA 資料集相比,Docmatix 的規模提升了 240 倍。過去用於 Idefics2 等模型的主要資料集包含 10,000 張影像與 39,000 組問答(Q/A)對,而 Docmatix 則提供:
- 影像: 240 萬
- 問答對: 950 萬
- 來源素材: 130 萬份 PDF 文件
生成管線與品質控制
Docmatix 是使用 PDFA OCR 資料集生成的,該資料集包含 210 萬份 PDF。技術管線包括以下步驟:
- 轉錄與生成: 來自 PDFA 的轉錄文本由 Phi-3-small 模型處理,以產生問答對。
- 過濾: 為維持資料品質,將 15% 的生成問答對視為幻覺而剔除。過濾使用正則表達式偵測程式碼,並移除包含關鍵字「unanswerable」的答案。
- 影像轉換: PDF 以 150 dpi 的解析度轉換為影像,並上傳至 Hugging Face Hub,以降低最終使用者的轉換資源需求。
提示最佳化與多樣性
為了最佳化資料集,Hugging Face 在首批小量資料上進行了消融研究,以調整 Phi-3 模型的提示。最佳化目標包括:
- 密度: 目標是每頁約四組問答對,以避免重疊(過多)或細節不足(過少)。
- 類人回應: 確保答案既不過於簡短,也不過長。
- 多樣性: 透過引導 Phi-3 模型根據文件內的特定資訊提出問題(例如「John Doe 的職稱是什麼?」),以最小化重複。
效能基準
評估使用 Florence-2 模型(7 億參數)進行。比較了兩個版本的 Florence-2:一個在標準 DocVQA 資料集上微調,另一個在 Docmatix 的子集(20% 影像與 4% 問答對)上微調,之後在 DocVQA 上進行一次 epoch 的格式化微調。
| 資料集 | DocVQA 上的 ANSL | 模型大小 |
|---|---|---|
| Florence-2 fine-tuned on DocVQA | 60.1 | 700M |
| Florence-2 fine-tuned on Docmatix | 71.4 | 700M |
| Idefics2 | 74.0 | 8B |
結果顯示,經 Docmatix 微調的 7 億參數 Florence-2 模型僅比 80 億參數的 Idefics2 模型差 5%,展現了大規模資料集的效率。