Osilly/Vision-DeepResearch

[ICML 2026 & EMNLP 2026] Multimodal deep-research MLLM and benchmark. The first long-horizon multimodal deep-research MLLM, extending the number of reasoning turns to dozens and the number of search-engine interactions to hundreds.

解决的问题

Vision-DeepResearch 解决了多模态大语言模型(MLLM)在执行需要迭代视觉和文本搜索的复杂深度研究任务时的能力局限。该框架通过激励 MLLM 的深度研究能力,将这些能力从静态图像扩展到连续视频流,实现了 Video-DeepResearch。

工作原理

该项目采用包含监督微调(SFT)和强化学习(RL)的训练流水线,以增强模型的研究能力。它利用数据流水线生成面向研究的多模态数据,并整合「Extract」模型用于摘要网页内容,以及「Judge」模型用于在 RL 训练期间评估性能。该系统可作为代理工作流部署,与搜索 API(如 SERP 和 Jina)交互,以收集和整合信息。

适用人群

本项目专为从事多模态代理、LLM 深度研究能力以及计算机视觉与信息检索交叉领域的 AI 研究人员和开发者设计。

主要亮点

  • 多模态研究代理:构建能够跨图像和视频进行深度研究的 MLLM。
  • VDR-Bench:专为重新思考 MLLM 的视觉和文本搜索而设计的基准测试。
  • 全面的训练工具包:包含 SFT 和 RL 的代码,以及冷启动和 RL 用数据集。
  • 视频扩展:通过 Video-DeepResearch 将深度研究能力扩展至连续视频流。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目