ConTextual:文本丰富场景中的多模态推理基准
加州大学洛杉矶分校(UCLA)的研究人员推出了 ConTextual,这是一套专门的数据集和排行榜,旨在评估大型多模态模型(LMM)进行上下文敏感、文本丰富的视觉推理的能力。该基准填补了当前 LMM 评估中的关键空白——现有评估往往侧重于简单指令的执行,而非理解视觉上下文中文本所需的联合推理,例如导航地图或解读表情包。
数据集组成与范围
ConTextual 包含 506 条具有挑战性的指令,配以文本丰富的图像。数据集的设计确保任务需要对文本和视觉线索进行联合推理才能得到正确答案。它涵盖了八种真实世界的视觉场景:
- 时间阅读
- 购物
- 导航
- 抽象场景
- 移动应用
- 网页
- 信息图
- 其他自然场景
数据集提供两种格式:一个包含 100 条实例(包括指令、图像和参考答案)的验证集,以及仅包含指令和图像的测试集。
实验结果与模型表现
初步实验评估了 13 种模型,分为三类:增强型 LLM(GPT-4 与 OCR/字幕结合)、闭源 LMM(GPT-4V 与 Gemini-Vision-Pro)以及开源 LMM(包括 LLaVA-v1.5-13B、ShareGPT4V-7B 和 Idefics-9B)。
评估方法论
评估采用 “LLM‑as‑a‑judge” 方法进行。使用 GPT-4 作为评审,判断预测的回答相较于人工参考答案是否可接受,因为该方法与人工判断的相关性最高。
关键性能发现
- 整体困难: 与人类表现相比,专有和开源 LMM 在 ConTextual 数据集上均表现不佳,表明模型改进有巨大的空间。
- 领域差距: 包括 GPT-4V 在内的专有模型在信息图推理和时间阅读任务上表现不佳。虽然 GPT-4V 在抽象推理上超越人类——可能得益于对表情包和引用的接触,但在时间相关任务上却不及人类。
- 开源模型局限: 如 LLaVA-1.5-13B 和 ShareGPT-4V-7B 等模型在抽象/自然场景与购物、导航、移动使用等其他领域之间存在显著性能差距,表明这些领域对模型而言是分布外的。
- 增强型 LLM 的失败: 将标准 LLM 与 OCR 或图像字幕结合后表现不佳,仅达到 17.2% 的人工批准率。这凸显这些任务需要精确的视觉感知和细粒度的视觉‑语言对齐,而非简单的文本转换。
LMM 发展未来方向
为提升上下文敏感、文本丰富的视觉推理,研究人员建议聚焦三个主要技术方向:
- 增强图像编码器: 开发更强大的编码器,以更好地捕获视觉细节。
- 精准图像描述: 创建更高保真度的视觉元素描述。
- 细粒度视觉‑语言对齐: 改进视觉与文本标记之间的对齐,以减轻幻觉并提升感知。
社区提交指南
研究人员可通过以下方式将模型提交至 ConTextual 排行榜:
- 验证集: 使用 GitHub 上的自动评估流水线,并通过 Hugging Face 排行榜表单提交 JSON 格式的结果,将图像 URL 映射为布尔分数(0 或 1)。
- 测试集: 将模型预测(将图像 URL 映射为预测响应)直接通过电子邮件发送给研究团队进行评估。