Mistral Agentic Search 출시

Mistral AI는 기업이 복잡하고 밀도가 높으며 민감한 데이터 소스를 탐색할 수 있도록 설계된 다단계 검색 시스템인 Agentic Search를 발표했습니다. 기존의 검색 증강 생성(RAG)과 달리, Agentic Search는 모델이 여러 문서에 걸쳐 정보를 반복적으로 검색, 조사 및 검증할 수 있도록 하여 데이터 집약적인 도메인에서 정확도를 크게 향상시킵니다.

One-Shot RAG의 한계 극복

전통적인 one-shot RAG는 고정된 텍스트 청크 세트를 검색하고 단 한 번의 패스로 답변을 시도합니다. Mistral은 복잡한 데이터를 다룰 때 이 방식에서 발생하는 세 가지 주요 실패 지점을 식별했습니다:

  • 추론 없는 검색: 모델은 추가적인 문맥을 요청할 수 있는 능력 없이, 제공된 초기 청크가 불완전하거나 관련이 없더라도 이를 사용하여 답변하도록 강제됩니다.
  • 청크 수준의 한계: 모델이 전체 문서를 열거나 특정 영역으로 이동할 수 없을 때, 멀티모달 문서(예: 표 또는 각주)의 중요한 데이터가 손실되는 경우가 많습니다.
  • 반복의 부재: One-shot RAG는 검색 쿼리를 개선하거나, 문서 간의 참조를 따르거나, 여러 소스를 비교하여 답변을 검증할 수 없습니다.

기술적 구현: Mistral Search Toolkit

Agentic Search는 데이터를 수집, 임베딩 및 인덱싱하기 위한 오픈 모듈을 제공하는 Mistral Search Toolkit을 통해 구동됩니다. 이 시스템은 AI 모델에 파일 시스템 작업과 유사하게 작동하는 다섯 가지 특정 도구를 부여합니다:

  1. search: 기존 인덱스를 사용하여 코퍼스 전체에서 관련 문서를 찾습니다.
  2. open: 특정 문서를 엽니다.
  3. navigate: 문서 내의 특정 페이지, 섹션 또는 영역으로 이동합니다.
  4. read: 현재 위치의 콘텐츠를 가져옵니다.
  5. grep: 열린 문서 내에서 특정 패턴을 찾습니다.

이 아키텍처는 도구가 모델별 미세 조정(fine-tuning)을 필요로 하지 않기 때문에, 검색 품질이 고정된 청킹 전략에 의해 제한되는 대신 모델의 추론 능력에 따라 확장된다는 것을 보장합니다.

성능 벤치마크

Mistral은 두 가지 산업 표준 벤치마크를 사용하여 Mistral Medium 3.5 (MM 3.5) 및 Z.ai GLM-5.2 (GLM-5.2)를 대상으로 Agentic Search를 테스트했습니다.

FinanceBench (SEC Filings)

368개의 SEC filings (~53,900페이지)를 대상으로 테스트한 결과는 다음과 같습니다:

  • 정확도 향상: One-shot RAG에서 검색 전용 에이전트 루프(search-only agentic loop)로 전환 시 MM 3.5는 +47.3%p(pp), GLM-5.2는 +52.6%p(pp)의 정확도가 향상되었으며, 이는 정확도에서 약 3배의 개선(26.7%에서 86%로)을 나타냅니다.
  • 탐색 영향: open, navigate, read, 및 grep 도구를 추가하면 MM 3.5는 +8.7%p(pp), GLM-5.2는 +6.7%p(pp)의 정확도가 추가로 향상되었습니다.
  • 효율성: 전체 루프는 검색 전용 루프와 비교하여 MM 3.5의 토큰 사용량을 23.9% 감소시키고 GLM-5.2의 토큰 사용량을 33.7% 감소시켰습니다.
  • 지연 시간: p90 지연 시간은 255초에서 154초로 감소했고, 평균 지연 시간은 108초에서 71초로 감소했습니다.

OfficeQA Pro (Treasury Bulletins)

스캔된 표 중심의 정부 금융 PDF (~89,000페이지) 696개를 대상으로 테스트한 결과는 다음과 같습니다:

  • 정확도 향상: 전체 에이전트 루프는 GLM-5.2의 정확도를 51.9%로(+45.6%p(pp)) 높였고, MM 3.5는 one-shot RAG와 비교하여 정확도를 +27.1%p(pp) 개선했습니다.
  • 효율성: 탐색 도구는 토큰 소비를 줄이고 턴(turn) 수를 최대 7.0%까지 감소시켰습니다.
  • Harness Comparison: GLM-5.2는 Mistral harness에서 51.9%를 기록했으며, Claude Code harness를 사용할 때의 41.4%와 비교하여 +10.5%p(pp)의 차이를 보였습니다.

사용 사례 적용 가능성

Mistral은 Agentic Search와 전통적인 인덱스 검색(indexed retrieval)의 사용 시점을 다음과 같이 구분합니다:

Agentic Search 사용 시:

  • 길고 밀도가 높은 문서: 답변이 특정 표, 조항 또는 각주에 있는 공시 서류, 계약서 및 기술 사양서.
  • cross-source research: 여러 문서의 증거를 조정해야 하는 작업.
  • 검증 가능한 답변: 응답이 안정적인 문서 위치와 연결되어야 하는 금융 또는 법률 데이터.
  • 구조화된 데이터: 의미가 공간적 레이아웃(행/열)에 따라 결정되는 스캔된 PDF 및 재무제표.

Indexed Retrieval (One-Shot RAG) 사용 시:

  • 직접적인 조회: 답변이 처음 몇 개의 검색된 청크에 있을 가능성이 높은 짧은 문서.
  • High-volume search: 추론이 필요하지 않은 단순 키워드 또는 의미론적 조회.
  • 예측 가능한 질문: 답변의 출처처와 위치를가 미리 알고 있는 사용 사례.

가용성 및 통합

Agentic Search는 커스텀 에이전트 통합을 위한 Mistral Search Toolkit을 통해 사용할 수 있으며, Mistral Studio 및 Vibe 내의 Libraries에 내장되어 있습니다. 사용자는 커스텀 코퍼스를 위한 로컬 인덱스를 제공하는 Search Starter App을 통해 테스트를 시작할 수 있습니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • 프로젝트
  • 프로젝트