Osilly/Vision-DeepResearch

[ICML 2026 & EMNLP 2026] Multimodal deep-research MLLM and benchmark. The first long-horizon multimodal deep-research MLLM, extending the number of reasoning turns to dozens and the number of search-engine interactions to hundreds.

解決的問題

Vision-DeepResearch 解決了多模態大語言模型(MLLM)在執行需要反覆視覺與文字搜尋的複雜深度研究任務時的能力限制。該框架透過激勵 MLLM 的深度研究能力,將這些能力從靜態影像擴展至連續影片串流,實現了 Video-DeepResearch。

工作原理

本專案採用包含監督微調(SFT)與強化學習(RL)的訓練流程,以增強模型的研究能力。它利用資料流程生成面向研究的多模態資料,並整合「Extract」模型用於摘要網頁內容,以及「Judge」模型用於在 RL 訓練期間評估表現。該系統可作為代理工作流程部署,與搜尋 API(如 SERP 和 Jina)互動,以收集與整合資訊。

適用對象

本專案專為從事多模態代理、LLM 深度研究能力,以及電腦視覺與資訊檢索交叉領域的 AI 研究人員與開發者設計。

主要亮點

  • 多模態研究代理:建構能夠跨影像與影片進行深度研究的 MLLM。
  • VDR-Bench:專為重新思考 MLLM 的視覺與文字搜尋而設計的基準測試。
  • 全面的訓練工具包:包含 SFT 與 RL 的程式碼,以及冷啟動與 RL 用資料集。
  • 影片擴展:透過 Video-DeepResearch 將深度研究能力擴展至連續影片串流。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案