Tavily Deep Research: AI 연구 에이전트에서 최첨단 달성

Tavily는 컨텍스트 엔지니어링과 에이전트 자율성을 복잡한 오케스트레이션 로직보다 우선시하여 DeepResearch Bench에서 최고 성능을 달성하는 최첨단 연구 에이전트를 개발했습니다. 이 시스템은 quadratic 토큰 전파를 선형 증류 과정으로 대체하여 Open Deep Research 대비 토큰 소비를 66% 줄입니다.

Agent Harness 및 모델 진화

Agent Harness는 컨텍스트, 툴 호출, 루프 제어, 오류 처리를 관리하는 소프트웨어 계층입니다. Tavily는 이 Harness를 구축할 때 수작업 최적화를 제한하고 rigid한 가정을 피함으로써 미래 모델 성능 향상을 흡수하는 데 중점을 둡니다.

모델 및 툴 진화와 관련된 주요 통찰은 다음과 같습니다:

  • 모델 기능: 툴 호출 신뢰도의 최근 개선이 rígid 워크플로우에서 자율 에이전트로 초점을 이동시켰습니다. Tavily는 높은 재현율 요약, 툴 호출 신뢰도, 작성 간결성을 미래 모델 진화의 핵심 영역으로 식별합니다.
  • 툴 설계: 효과적인 툴은 컨텍스트 윈도우에 대량의 토큰을 덤프하는 대신 내부에서 컨텍스트 엔지니어링을 수행하여 가장 관련성 높은 데이터만 반환해야 합니다. Tavily의 "advanced search" 기능은 이 컨텍스트 엔지니어링을 통합하여 지연 시간과 환각을 줄입니다.

컨텍스트 엔지니어링 및 정보 증류

깨끗하고 최적화된 컨텍스트 윈도우를 유지하는 것은 장기 연구 작업에 매우 중요합니다. Tavily는 에이전트가 단일 연구 스레드에 과적합되는 것을 방지하고 효율적인 정보 수집을 보장하기 위해 'context-managed web retrieval' 전략을 사용합니다.

Human-Web Interaction 모델링

Tavily의 아키텍처는 인간 연구 행동을 모방합니다: 정보를 수집하고, 핵심 통찰(반성)으로 증류한 후, 이후 툴 호출의 컨텍스트로 오직 those 증류된 반성만 사용합니다. 원시 정보는 정보 손실을 방지하기 위해 결과물을 준비하는 최종 단계에서만 다시 도입됩니다.

토큰 효율성: 선형 vs. 이차 성장

LangChain의 Open Deep Research와 같은 전통적인 ReAct 에이전트 아키텍처는 일반적으로 루프를 통해 모든 툴 호출과 출력을 전파하여 다음과 같이 모델링된 이차 토큰 소비를 초래합니다:

$$n + 2n + 3n + dots + mn = n \cdot \frac{m(m + 1)}{2}$$

대조적으로, Tavily의 증류 방법은 이 전파를 제거하여 선형 토큰 성장을 초래합니다:

$$n + n + n + dots + n = nm$$

$\frac{m + 1}{2}$ 요인으로 토큰을 절약함으로써 Tavily는 DeepResearch Bench에서 최첨단(SOTA) 결과를 달성하면서 토큰 소비를 66% 줄였습니다.

자율 에이전트 프로덕션화

연구 에이전트를 프로덕션에 배포할 때는 자율성, 신뢰성, 비용 사이의 균형을 맞추어야 합니다.

비결정성에 대한 엔지니어링

LLM은 비결정적이기 때문에 Tavily는 실패 모드를 핵심 설계 고려 사항으로 간주합니다. 툴 호출 재시도와 모델 캐스케이드는 기본적인 지원을 제공하지만, 프로덕션급 에이전트는 이상 상황을 사전에 예측하고 프롬프트 및 엣지 케이스 테스트를 통해 올바른 추론 패턴을 강화해야 합니다.

툴셋 최적화

Tavily는 작은 필수 툴셋이 크고 복잡한 툴셋보다 더 효과적임을 발견했습니다. 툴셋을 과도하게 엔지니어링하면 종종 새로운 실패 모드가 도입되고 모델이 올바른 툴을 일관되게 선택하기 어려워집니다.

평가의 역할

Tavily는 평가를 절대적인 최적화 목표가 아닌 방향성 피드백에 활용합니다. LLM-as-a-judge 평가의 비결정적 특성과 장기 실행 에이전트의 시간 소모 특성 때문에 팀은 수치적 벤치마크 점수보다 에이전트 추적 모니터링과 직관을 우선시합니다. 프로덕션 시스템에서는 신뢰성, 낮은 지연 시간, 감소된 토큰 사용이 eval 점수의 미미한 증가보다 더 중요하게 여겨집니다.

Sources