Yuliang-Liu/MultimodalOCR
On the Hidden Mystery of OCR in Large Multimodal Models (OCRBench)
解決的問題
本倉儲提供一套基準測試,用於評估大型多模態模型(LMMs)處理視覺文字的能力。它解決了多語言文件解析、真實世界拍攝文件,以及跨多種文字與語言的複雜視覺文字定位與推理任務缺乏系統性評估的問題。
工作原理
此專案包含三個主要基準測試:
- MDPBench:專注於17種語言與多樣文字系統的多語言文件解析,測試模型在乾淨的數位頁面與真實世界拍攝文件上的表現。
- OCRBench v2:一個大規模雙語基準測試,使用10,000個經人工驗證的問答對,測試31種不同情境(如收據、公式、街景)中的視覺文字定位與推理能力。
- OCRBench:原始基準測試,評估核心OCR能力,包括文字識別、場景文字VQA、文件VQA、關鍵資訊提取以及手寫數學表達式識別。
適用對象
需要衡量其在光學字元識別(OCR)與文件理解任務上效能的大型多模態模型(LMMs)的研究人員與開發者。
亮點
- 多語言覆蓋:MDPBench涵蓋17種語言,包括低資源語言與非拉丁字母文字系統。
- 真實世界測試:特別評估模型在拍攝文件與數位文件上的表現差異。
- 全面情境覆蓋:OCRBench v2涵蓋31種不同的視覺文字情境。
- 人工驗證:所有基準測試均使用高品質的人工驗證標註,確保評估的準確性。
相關
- 專案
- 專案
- 專案
- 專案
- Dispatch