Osilly/Vision-DeepResearch
[ICML 2026 & EMNLP 2026] Multimodal deep-research MLLM and benchmark. The first long-horizon multimodal deep-research MLLM, extending the number of reasoning turns to dozens and the number of search-engine interactions to hundreds.
解決的問題
Vision-DeepResearch 解決了多模態大語言模型(MLLM)在執行需要反覆視覺與文字搜尋的複雜深度研究任務時的能力限制。該框架透過激勵 MLLM 的深度研究能力,將這些能力從靜態影像擴展至連續影片串流,實現了 Video-DeepResearch。
工作原理
本專案採用包含監督微調(SFT)與強化學習(RL)的訓練流程,以增強模型的研究能力。它利用資料流程生成面向研究的多模態資料,並整合「Extract」模型用於摘要網頁內容,以及「Judge」模型用於在 RL 訓練期間評估表現。該系統可作為代理工作流程部署,與搜尋 API(如 SERP 和 Jina)互動,以收集與整合資訊。
適用對象
本專案專為從事多模態代理、LLM 深度研究能力,以及電腦視覺與資訊檢索交叉領域的 AI 研究人員與開發者設計。
主要亮點
- 多模態研究代理:建構能夠跨影像與影片進行深度研究的 MLLM。
- VDR-Bench:專為重新思考 MLLM 的視覺與文字搜尋而設計的基準測試。
- 全面的訓練工具包:包含 SFT 與 RL 的程式碼,以及冷啟動與 RL 用資料集。
- 影片擴展:透過 Video-DeepResearch 將深度研究能力擴展至連續影片串流。
相關
- 專案
- 專案
- 專案
- 專案
- 專案