Hugging Face 發布 vdr-2b-multi-v1 多語言視覺文檔檢索模型
Hugging Face 已推出 vdr-2b-multi-v1,一種專為視覺文檔檢索設計的多語言嵌入模型,它將文檔頁面截圖編碼為密集的單向量表示。此方法使使用者能够在不需要 OCR、數據提取管道或手動分塊的情況下搜索和查詢視覺豐富的文檔。
模型關鍵能力
vdr-2b-multi-v1 相較於先前的視覺檢索方法提供了幾項技術優勢:
- 多語言支援: 該模型在意大利語、西班牙語、英語、法語和德語上進行訓練,實現跨語言檢索(例如,使用意大利語查詢搜索德語文檔)。
- 效率與速度: 僅英語版本
vdr-2b-v1透過使用 768 個圖像塊而非 2560 個,相比基礎模型實現了 3 倍更快的推理速度並顯著降低了 VRAM 使用量。 - Matryoshka 表示學習 (MRL): 該模型支援可變的向量大小;使用者可以將向量維度減少 3 倍,同時保留 98% 的嵌入品質,以優化存儲和檢索速度。
- 免 OCR 檢索: 透過直接編碼截圖,該模型繞過了傳統文字提取管道的複雜性。
vdr-multilingual-train 資料集
為了應對多語言多模態資料集的稀缺,Hugging Face 發布了 vdr-multilingual-train 資料集。這是目前最大的開源多語言合成視覺文檔檢索資料集,包含 500,000 個高品質樣本。
資料生成管道
- 資料收集: 約 50,000 份多語言文檔透過主題式搜索從公共互聯網抓取。為確保多樣性,頁面使用文件佈局分析模型被分類為純文字、純視覺或混合類型。
- 合成查詢生成: 查詢使用 Gemini 1.5 Pro 和 Qwen2-VL-72B 生成。這些模型被指派生成具體和通用的問題,以提升用於訓練的具體問題的強度。
- 清理與過濾: 查詢經過清理過程,以確保語言正確、格式適當,並移除定位短語(例如,