Osilly/Vision-DeepResearch

[ICML 2026 & EMNLP 2026] Multimodal deep-research MLLM and benchmark. The first long-horizon multimodal deep-research MLLM, extending the number of reasoning turns to dozens and the number of search-engine interactions to hundreds.

해결하는 문제

Vision-DeepResearch는 반복적인 시각적 및 텍스트 검색이 필요한 복잡한 심층 연구 작업을 수행하는 데 있어 다중모달 대규모 언어 모델(MLLM)의 한계를 해결합니다. 이 프로젝트는 MLLM의 심층 연구 능력을 유도하는 프레임워크를 제공하며, 정적 이미지에서 연속적인 비디오 스트림으로 능력을 확장하는 Video-DeepResearch를 통해 이를 확장합니다.

작동 방식

이 프로젝트는 모델의 연구 능력을 향상시키기 위해 Supervised Fine-Tuning(SFT)과 강화학습(RL)을 결합한 훈련 파이프라인을 사용합니다. 연구 중심의 다중모달 데이터를 생성하기 위한 데이터 파이프라인을 활용하며, 웹 페이지 내용을 요약하는 "Extract" 모델과 RL 훈련 중 성능을 평가하는 "Judge" 모델을 통합합니다. 시스템은 SERP 및 Jina와 같은 검색 API와 상호작용하여 정보를 수집하고 통합할 수 있는 에이전트 워크플로우로 배포할 수 있습니다.

대상 사용자

이 프로젝트는 다중모달 에이전트, LLM의 심층 연구 능력, 컴퓨터 비전과 정보 검색의 융합 분야에서 일하는 AI 연구자 및 개발자를 대상으로 합니다.

주요 특징

  • 다중모달 연구 에이전트: 이미지와 비디오를 통해 심층 연구가 가능한 MLLM 생성.
  • VDR-Bench: MLLM을 위한 시각적 및 텍스트 검색을 재고할 수 있는 전용 벤치마크.
  • 포괄적인 훈련 세트: SFT 및 RL 코드와 함께 콜드스타트 및 RL용 데이터셋 포함.
  • 비디오 확장: Video-DeepResearch를 통해 연속적인 비디오 스트림으로 심층 연구 능력 확장.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트