LAVE:使用 LLM 在 Docmatix 上的零樣本 VQA 評估
Hugging Face 推出了 LAVE(LLM 輔助 VQA 評估),這是一項利用大型語言模型(LLM)來評估視覺問答(VQA)表現的指標。此方法解決了傳統精確匹配指標在分布外(OOD)與零樣本設定下無法辨識語意正確答案的問題,特別是使用合成資料集如 Docmatix 時。
傳統 VQA 指標在 OOD 情境下的失效
傳統 VQA 評估依賴預測答案與參考答案之間的精確字串匹配,對於獨立且同分布(IID)的資料有效,但在分布外(OOD)情境中會失效。在零樣本遷移任務中,模型常產生語意正確卻在格式、具體性或解釋上與人工整理的參考答案不同的答案。
此差異在 Docmatix 開發過程中被觀察到:在資料集上微調 Florence-2 雖然取得了高語意表現,但基準分數卻很低。進一步在 DocVQA 基準上微調後,分數提升,因為模型學會了所需的語法,但人工評估者發現模型表現變差,顯示傳統指標並不總是與人類感知一致。
LAVE 評估方法
LAVE 將 VQA 評估框定為使用 LLM 進行上下文學習的答案評分任務。它不採用二元匹配,而是使用細緻的評分尺度,以考量答案的模糊性與不完整性。
評分尺度與提示
LAVE 使用 1 到 3 的評分尺度:
- 1:答案錯誤或不相關。
- 2:答案模糊或不完整。
- 3:答案正確。
為確保高品質的評分,會提示 LLM 在給出最終評分前先提供理由,且嚴格指示只能給出一個評分。對於二元問題,提示明確要求正確評分只能是「yes」或「no」。
計分函數
最終評分 ($r$) 從 LLM 回應的最後一個字元取得,並使用以下公式映射至 [0, 1] 範圍的分數 ($s$):
$s = \frac{r - 1}{2}$
Docmatix 的實驗結果
為測試 LAVE,Hugging Face 使用 MPLUGDocOwl1.5 作為基線模型(在原始 DocVQA 測試子集上取得 84% ANLS 分數),並在 Docmatix 的 200 張影像子集上進行零樣本生成。評分 LLM 採用 Llama-2-Chat-7b。
量化比較
將 LAVE 與傳統指標比較,可見模型表現感知上有顯著差距:
| 指標 | 分數 |
|---|---|
| CIDER | 0.1411 |
| BLEU | 0.0032 |
| ANLS | 0.002 |
| LAVE | 0.58 |
主要收穫
使用 LLM 進行評估相較於傳統指標提升約 50% 的準確率。這表明目前的 VQA 評估標準過於僵硬,可能會懲罰以非標準格式提供正確資訊的模型。研究結果顯示,需要更貼合人類判斷的評估指標,特別是在評估合成資料集的零樣本表現時。