Hugging Face Open-source DeepResearch

Hugging Face는 OpenAI의 Deep Research 기능을 재현하도록 설계된 에이전트 프레임워크를 개발하고 오픈소스로 공개했습니다. 코드네이티브 에이전트 접근 방식을 활용하여, 시스템은 GAIA 벤치마크 검증 세트에서 55.15% 점수를 달성했으며, 이는 이전 오픈소스 프레임워크 벤치마크에 비해 크게 향상된 결과입니다.

LLM 성능에서 에이전트 프레임워크의 역할

에이전트 프레임워크는 대형 언어 모델 (LLM) 위에 통합된 레이어로, 모델이 웹 브라우징이나 PDF 문서 읽기와 같은 작업을 수행하고 이러한 작업을 구조화된 단계 시리즈로 구성할 수 있게 합니다.

에이전트 시스템에 LLM을 통합하면 독립형 모델에 비해 상당한 성능 향상을 얻을 수 있습니다. Hugging Face에 따르면 smolagents 라이브러리를 사용하면 특정 벤치마크에서 성능이 최대 60점까지 향상될 수 있습니다. 이는 OpenAI의 발견과 일치하는데, OpenAI는 Deep Research가 "Humanity’s Last Exam" 벤치마크에서 독립형 LLM보다 znacz하게 더 나은 성능을 보였다고 지적했습니다.

GAIA와의 벤치마크

일반 AI 어시스턴트 (GAIA) 벤치마크는 고수준 계획과 엄격한 실행을 요구하기 때문에 이러한 시스템을 평가하는 데 사용됩니다. GAIA 질문은 일반적으로 다음을 포함합니다:

  • 제한된 형식: 특정 구조의 답변을 요구함.
  • 멀티모달 기능: 이미지에서 정보 추출.
  • 정보 수집: 서로 의존적인 여러 데이터 조각 찾기.
  • 복잡한 연결: 문제 해결 경로를 올바른 순서대로 실행.

독립형 GPT-4는 GAIA 검증 세트에서 7% 미만의 점수를 받는 반면, OpenAI의 Deep Research는 67.36%를 달성했습니다. Hugging Face 오픈소스 구현은 현재 55.15% 점수를 기록하고 있습니다.

기술적 구현: CodeAgents 및 도구

코드네이티브 에이전트의 장점

Hugging Face는 에이전트가 JSON 대신 코드로 행동을 표현하는 "CodeAgent"를 사용합니다. 이 접근 방식은 여러 가지 기술적 장점을 제공합니다:

  • 간결성: 코드를 사용하면 복잡한 행동 시퀀스를 더 효율적으로 표현할 수 있습니다. 예를 들어, 병렬 행동 스트림을 실행할 때 JSON 블롭보다 코드에서 훨씬 적은 단계가 필요합니다.
  • 효율성: 코드 행동은 JSON보다 약 30% 적은 단계가 필요하며, 토큰 생성을 줄이고 운영 비용을 낮춥니다.
  • 상태 관리: 코드는 상태를 더 잘 처리할 수 있게 하며, 특히 멀티모달 작업에서 이미지나 오디오를 변수에 할당하여 여러 단계에서 재사용할 수 있습니다.
  • 성능: LLMs은 훈련 중에 코드에 광범위하게 노출되어 코드에서 일반적으로 더 나은 성능을 보입니다.

도구 통합

현재 개념 증명에서는 Microsoft Research의 Magentic-One에서 변형된 두 가지 주요 도구를 사용합니다:

  1. 텍스트 기반 웹 브라우저: 초기 웹 상호작용을 위한 간단한 브라우저.
  2. 텍스트 인스펙터: 다양한 텍스트 파일 형식을 읽을 수 있는 도구.

결과 및 비교

24시간 재현 스프린트 동안, Hugging Face는 GAIA에서 오픈소스 최첨단 성능을 약 46% (Magentic-One)에서 55.15%로 향상시켰습니다. 동일한 설정을 JSON 기반 에이전트로 전환했을 때 검증 세트에서 성능이 33%로 떨어진 것을 통해 코드네이티브 접근 방식의 중요성이 강조되었습니다.

미래 로드맵 및 커뮤니티 노력

독점 시스템과 완전한 동등성을 달성하기 위해, Hugging Face는 브라우저 상호작용 개선이 필요하다고 판단합니다. 개발의 다음 단계는 화면을 보고 마우스와 키보드를 통해 직접 상호작용할 수 있는 GUI 에이전트를 구축하는 데 중점을 둡니다.

다른 커뮤니티에서의 Deep Research 구현은 dzhng, assafelovic (gpt-researcher), nickscamara, jina-ai, mshumer와 같은 기여자들로부터 등장했습니다. Hugging Face는 DeepSeek R1과 같은 오픈 LLM을 사용하여 이러한 결과를 추가로 벤치마크하고 비전 LMs 통합을 탐구하는 것을 목표로 합니다.

Sources