Kapa.ai RAG를 위한 이미지 인덱싱

인덱싱 시점에 이미지를 인덱싱하는 것이 쿼리 시점의 멀티모달 RAG보다 우수함

Kapa.ai는 매 쿼리마다 원본 이미지를 비전 모델에 전달하는 대신, 인덱싱 단계에서 이미지를 한 번 설명하는 것이 RAG 파이프라인에 시각적 데이터를 통합하는 가장 확장 가능하고 비용 효율적인 방법이라고 판단했습니다. 이 접근 방식은 텍스트 전용 시스템과 비교했을 때 쿼리당 오버헤드를 1%에서 6% 사이로 줄이면서, 통계적으로 답변 품질을 향상시킵니다 (p < 0.05).

기술 문서에서 이미지의 역할

기술 문서의 이미지는 일반적으로 두 가지 범주로 나뉘며, 두 범주 모두 최종 사용자에게 중요한 가치를 제공합니다:

  • 설명적 이미지 (Illustrative Images): 기존 텍스트를 명확하게 합니다 (예: 설정 아이콘의 위치를 보여주는 스크린샷). 이는 지침을 실행하기 더 쉽게 만듭니다.
  • 정보 전달형 이미지 (Load-bearing Images): 텍스트에 없는 고유한 데이터를 포함합니다 (예: 배선도, 사양 테이블 또는 색상 가용성 매트릭스). 이러한 경우, 이미지는 답변의 주요 소스입니다.

이미지 컨텍스트가 사용 가능할 때, LLM 판독기는 여러 모델과 고객 프로젝트에 걸쳐 결과 답변을 일관되게 선호하며, 이는 사용자가 지원 티켓을 생성하는 대신 스스로 문제를 해결할 수 있도록 돕습니다.

쿼리 시점의 멀티모달 프로세싱이 대규모 환경에서 실패하는 이유

검색된 이미지를 비전 기능이 있는 모델 (예: GPT 5.1 또는 Claude 4.6 Sonnet)에 직접 전달하는 것은 세 가지 주요 구조적 병목 현상을 생성합니다:

  1. 과도한 경제적 비용: 원본 이미지는 쿼리당 비용을 크게 증가시킵니다. Kapa.ai의 테스트 결과, 이미지는 GPT에서 비용을 27%, Claude에서 51%를 추가했습니다. 이는 주로 높은 토큰화 비용 (GPT의 경우 이미지당 약 716개 토큰, Claude의 경우 약 975개 토큰) 때문입니다.
  2. 페이로드 제한: 고밀도 문서는 쿼리당 20-30개의 이미지를 검색하는 경우가 많습니다. Claude의 30 MB 및 OpenAI의 50 MB 페이로드 제한으로 인해, 시스템은 빠르게 한계에 도달하며, 유용한 컨텍스트를 제거하는 공격적인 이미지 제한이 강제됩니다.
  3. 검색 효율성 저하: CLIP 스타일의 멀티모달 임베딩은 기술적 차트와 테이블의 세밀한 디테일을 포착하는 데 종종 실패합니다. 또한, 짧은 기술적 쿼리는 이미지 벡터와 효과적으로 매칭되는 데 충분한 신호를 제공하지 못하는 경우가 많습니다.

"설명 한 번" 아키텍처

이러한 문제를 해결하기 위해 Kapa.ai는 인덱싱 시점에 이미지를 텍스트로 변환하는 워크플로우를 구현합니다:

  • 인덱싱 단계: 비전 언어 모델 (VLM)이 모든 이미지에 대해 상세한 캡션 또는 전사 내용을 생성합니다. 정보 전달형 이미지의 경우, VLM은 실제 값과 레이블을 전사합니다.
  • 저장: 이 캡션들은 지식 베이스에 별도의 텍스트 청크로 저장됩니다.
  • 쿼리 단계: 검색기는 캡션을 일반 텍스트로 취급합니다. 캡션이 관련이 있는 경우, 모델은 텍스트 설명을 사용하여 쿼리를 답변하고 원본 이미지 URL을 인용합니다.

이 아키텍처는 계산 비용이 많이 드는 이미지

Sources