NVIDIA AI-Q Blueprint: DeepResearch Bench에서 최고 순위의 오픈 딥 리서치 에이전트

NVIDIA의 AI-Q Blueprint는 휴대 가능하고 오픈 딥 리서치 에이전트로, DeepResearch Bench에서 Hugging Face의 "LLM with Search" 리더보드 상위에 올랐습니다. 이 성과는 오픈 소스 AI 스택이 폐쇄형 대안에 필적하거나 능가하는 고급 에이전트 워크플로우를 구동할 수 있음을 보여줍니다.

핵심 기술 스택 및 아키텍처

AI-Q Blueprint는 두 개의 고성능 오픈 LLM을 결합하여 장기 컨텍스트 검색, 에이전트 추론 및 합성을 관리합니다:

  • Llama 3.3-70B Instruct: 유창하고 구조화된 보고서를 생성하기 위한 기반으로 사용됩니다.
  • Llama-3.3-Nemotron-Super-49B-v1.5: 신경 아키텍처 탐색(NAS), 지식 증류, 감독 및 강화 학습을 통해 최적화된 추론 중심 변형입니다. 다단계 추론, 질의 계획, 도구 사용 및 반성을 위해 특별히 설계되었습니다.

이 모델들을 지원하기 위해, 참고 예제는 내부 및 외부 데이터 전반에 걸친 확장 가능한 멀티모달 검색을 위해 NVIDIA NeMo Retriever를, 복잡하고 다단계 워크플로우를 조정하기 위해 NVIDIA NeMo Agent toolkit을 통합합니다. 이 아키텍처는 로컬 및 웹 데이터에 대한 병렬 저지연 검색을 가능하게 하여 높은 프라이버시와 규정 준수가 요구되는 환경에서의 배포를 용이하게 합니다.

Llama Nemotron의 깊은 추론 능력

Llama-3.3-Nemotron-Super-49B-v1.5는 명시적인 에이전트 추론을 위해 사후 학습되었으며, 시스템 프롬프트를 통해 추론을 켜거나 끌 수 있습니다. 이를 통해 모델은 표준 채팅 LLM으로 동작하거나 에이전트 파이프라인을 위한 깊은 사고 흐름(chain-of-thought) 추론 엔진으로 활용될 수 있습니다.

주요 기술 사양은 다음과 같습니다:

  • Post-training: 명령 수행, 수학/프로그래밍 추론, 도구 호출 기술을 결합한 다단계 접근 방식.
  • Efficiency: 49B 파라미터와 최대 128K 토큰의 컨텍스트 윈도우를 갖추어 단일 H100 GPU 또는 그 이하에서도 실행 가능하며, 예측 가능한 빠른 추론 비용을 보장합니다.
  • Lineage: 모델은 오픈 Meta 가중치에서 직접 추적 가능하며, 합성 데이터와 튜닝 데이터셋에 대한 투명성을 제공합니다.

평가 지표 및 투명성

AI-Q는 추론 추적 및 중간 단계의 투명성을 강조합니다. 개발 팀은 견고성을 보장하기 위해 표준 및 특수 지표를 결합하여 사용했습니다:

  • Hallucination Detection: 사실적 주장에 대해 생성 과정 중 검증합니다.
  • Multi-source Synthesis: 서로 다른 증거로부터 새로운 통찰을 합성하는 능력.
  • Citation Trustworthiness: 주장과 증거 사이의 연결을 자동으로 평가합니다.
  • RAGAS Metrics: 검색 강화 생성 정확도에 대한 자동 점수화.

DeepResearch Bench 성능

DeepResearch Bench는 과학, 금융, 예술, 역사, 소프트웨어 등 분야의 100개가 넘는 장기 컨텍스트 실제 연구 과제를 사용해 에이전트 스택을 평가합니다. 이러한 과제는 단순 QA가 아니라 복잡한 다단계 추론 및 보고서 수준의 합성을 요구합니다.

2025년 8월 현재, AI-Q는 LLM with Search 카테고리에서 전체 점수 40.52를 달성했으며, 완전 오픈 라이선스 스택 중 최고 순위를 차지했습니다. 시스템의 가장 강력한 성능 지표는 포괄성(보고서 깊이), 통찰력(분석 품질), 그리고 인용 품질이었습니다.

개발자를 위한 제공

Llama-3.3-Nemotron-Super-49B-v1.5와 Llama 3.3-70B Instruct는 모두 Hugging Face에서 다운로드할 수 있습니다. 개발자는 Python을 사용해 자체 파이프라인에 이 모델들을 통합하거나, 빠른 추론 및 도구 호출 지원을 위해 vLLM으로 배포할 수 있습니다.

Sources