LAVE: LLM을 활용한 Docmatix의 제로샷 VQA 평가

Hugging Face는 대형 언어 모델(LLM)을 이용해 시각적 질문 응답(VQA) 성능을 평가하는 메트릭인 LAVE(LLM‑Assisted VQA Evaluation)를 도입했습니다. 이 접근 방식은 전통적인 정확도 매칭 메트릭이 분포 외(OOD) 및 제로샷 상황에서 의미적으로 올바른 답변을 인식하지 못하는 문제를 해결합니다. 특히 Docmatix와 같은 합성 데이터셋을 사용할 때 유용합니다.

OOD 환경에서 전통적인 VQA 메트릭의 한계

전통적인 VQA 평가는 예측 답변과 정답 사이의 문자열을 정확히 일치시키는 방식에 의존합니다. 이는 독립적이고 동일하게 분포된(IID) 데이터에서는 효과적이지만, 분포 외(OOD) 상황에서는 실패합니다. 제로샷 전이 작업에서는 모델이 의미적으로는 올바른 답변을 생성하지만, 형식·구체성·해석 측면에서 인간이 만든 정답과 다를 수 있습니다.

이러한 불일치는 Docmatix를 개발하면서 관찰되었습니다. 데이터셋에 Florence-2를 파인튜닝했을 때 의미적 성능은 높았지만 벤치마크 점수는 낮았습니다. 이후 DocVQA 벤치마크에 추가 파인튜닝을 하면 점수는 상승했지만, 인간 평가자는 모델 성능이 오히려 떨어졌다고 판단했습니다. 이는 전통적인 메트릭이 인간 인식과 항상 일치하지 않음을 보여줍니다.

LAVE 평가 방법

LAVE는 VQA 평가를 LLM을 활용한 답변 등급 매기기 작업으로 전환합니다. 이진 매칭 대신, 모호함과 불완전성을 고려한 세밀한 등급 척도를 사용합니다.

등급 척도 및 프롬프트

LAVE는 1~3의 등급 척도를 사용합니다:

  • 1: 틀리거나 관련 없는 답변.
  • 2: 모호하거나 불완전한 답변.
  • 3: 올바른 답변.

고품질 등급을 확보하기 위해 LLM에게 최종 등급을 제시하기 전에 이유를 제공하도록 프롬프트하고, 반드시 하나의 등급만 제시하도록 엄격히 지시합니다. 이진 질문의 경우, 프롬프트에 ‘yes’ 또는 ‘no’만이 올바른 등급으로 허용된다고 명시합니다.

점수 함수

최종 등급 (r) 은 LLM 응답의 마지막 문자에서 추출하고, 다음 식을 이용해 [0, 1] 범위의 점수 (s) 로 변환합니다:

$s = \frac{r - 1}{2}$

Docmatix에 대한 실험 결과

LAVE를 테스트하기 위해 Hugging Face는 기본 모델로 MPLUGDocOwl1.5(원본 DocVQA 테스트 서브셋에서 84% ANLS 점수) 를 사용했으며, Docmatix 200장 이미지 서브셋에 대해 제로샷 생성 실험을 수행했습니다. 등급 매기기 LLM으로는 Llama-2-Chat-7b 를 활용했습니다.

정량적 비교

LAVE와 전통적인 메트릭을 비교하면 모델 성능 인식에 큰 차이가 있음을 확인할 수 있습니다:

지표 점수
CIDER 0.1411
BLEU 0.0032
ANLS 0.002
LAVE 0.58

주요 시사점

LLM을 활용한 평가 방식은 전통적인 메트릭에 비해 약 **50%**의 정확도 향상을 보였습니다. 이는 현재 VQA 평가 기준이 지나치게 경직되어 비표준 형식으로 올바른 정보를 제공하는 모델을 불이익을 줄 수 있음을 시사합니다. 특히 합성 데이터셋에서 제로샷 성능을 평가할 때 인간 판단과 보다 잘 맞는 평가 메트릭이 필요함을 보여줍니다.

Sources