Osilly/Vision-DeepResearch
[ICML 2026 & EMNLP 2026] Multimodal deep-research MLLM and benchmark. The first long-horizon multimodal deep-research MLLM, extending the number of reasoning turns to dozens and the number of search-engine interactions to hundreds.
解决的问题
Vision-DeepResearch 解决了多模态大语言模型(MLLM)在执行需要迭代视觉和文本搜索的复杂深度研究任务时的能力局限。该框架通过激励 MLLM 的深度研究能力,将这些能力从静态图像扩展到连续视频流,实现了 Video-DeepResearch。
工作原理
该项目采用包含监督微调(SFT)和强化学习(RL)的训练流水线,以增强模型的研究能力。它利用数据流水线生成面向研究的多模态数据,并整合「Extract」模型用于摘要网页内容,以及「Judge」模型用于在 RL 训练期间评估性能。该系统可作为代理工作流部署,与搜索 API(如 SERP 和 Jina)交互,以收集和整合信息。
适用人群
本项目专为从事多模态代理、LLM 深度研究能力以及计算机视觉与信息检索交叉领域的 AI 研究人员和开发者设计。
主要亮点
- 多模态研究代理:构建能够跨图像和视频进行深度研究的 MLLM。
- VDR-Bench:专为重新思考 MLLM 的视觉和文本搜索而设计的基准测试。
- 全面的训练工具包:包含 SFT 和 RL 的代码,以及冷启动和 RL 用数据集。
- 视频扩展:通过 Video-DeepResearch 将深度研究能力扩展至连续视频流。
相关
- 项目
- 项目
- 项目
- 项目
- 项目