LAVE:使用大型语言模型对 Docmatix 进行零样本 VQA 评估
Hugging Face 推出了 LAVE(大型语言模型辅助的 VQA 评估),这是一种利用大型语言模型(LLM)来评估视觉问答(VQA)性能的指标。该方法解决了传统精确匹配指标在分布外(OOD)和零样本设置下无法识别语义正确答案的问题,尤其是在使用诸如 Docmatix 之类的合成数据集时。
传统 VQA 指标在 OOD 场景中的失效
传统的 VQA 评估依赖于预测答案与参考答案之间的精确字符串匹配,这在独立同分布(IID)数据上有效,但在分布外(OOD)情境下会失效。在零样本迁移任务中,模型常常生成语义上正确的答案,但在格式、具体性或解释上与人工策划的参考答案不同。
在 Docmatix 的开发过程中观察到了这种差异:在该数据集上微调 Florence-2 能够获得高语义性能,却得到低的基准分数。进一步在 DocVQA 基准上微调通过教授模型所需的语法提升了分数,但人工评估者发现模型的实际表现更差,这表明传统指标并不总是与人类感知保持一致。
LAVE 评估方法
LAVE 将 VQA 评估框定为使用 LLM 进行上下文学习的答案评分任务。它不采用二元匹配,而是使用细致的评分尺度来考虑答案的模糊性和不完整性。
评分尺度与提示
LAVE 使用 1 到 3 的评分尺度:
- 1:错误或无关的答案。
- 2:模糊或不完整的答案。
- 3:正确的答案。
为了确保高质量的评分,提示 LLM 在给出最终评分前提供理由,并严格指示只能给出一个评分。对于二元问题,提示明确要求只有“yes”或“no”才算作正确评分。
评分函数
最终评分 ($r$) 从 LLM 响应的最后一个字符中提取,并使用以下公式将其映射到 [0, 1] 范围的分数 ($s$):
$s = \frac{r - 1}{2}$
Docmatix 实验结果
为了测试 LAVE,Hugging Face 使用 MPLUGDocOwl1.5 作为基线模型(该模型在原始 DocVQA 测试子集上获得 84% 的 ANLS 分数),并在 Docmatix 的 200 张图像子集上进行零样本生成。评分 LLM 采用 Llama-2-Chat-7b。
定量比较
将 LAVE 与传统指标进行比较,揭示了模型性能感知上的显著差距:
| 指标 | 分数 |
|---|---|
| CIDER | 0.1411 |
| BLEU | 0.0032 |
| ANLS | 0.002 |
| LAVE | 0.58 |
关键要点
使用 LLM 进行评估相较于传统指标提升了约 50% 的准确率。这表明当前的 VQA 评估标准过于僵硬,可能会惩罚以非标准格式提供正确信息的模型。研究结果显示,需要更符合人类判断的评估指标,尤其是在评估合成数据集上的零样本性能时。