Osilly/Vision-DeepResearch

[ICML 2026 & EMNLP 2026] Multimodal deep-research MLLM and benchmark. The first long-horizon multimodal deep-research MLLM, extending the number of reasoning turns to dozens and the number of search-engine interactions to hundreds.

何を解決するか

Vision-DeepResearchは、マルチモーダル大規模言語モデル(MLLM)が反復的な視覚的およびテキスト検索を必要とする複雑な深層研究タスクを実行する能力に限界があるという問題に対処します。このフレームワークは、MLLMに深層研究能力を促進する仕組みを提供し、静止画像から連続的な動画ストリームへとその能力を拡張するVideo-DeepResearchを実現します。

仕組み

このプロジェクトは、教師あり微調整(SFT)と強化学習(RL)を組み合わせたトレーニングパイプラインを採用し、モデルの研究能力を強化します。研究指向のマルチモーダルデータを生成するためのデータパイプラインを活用し、Webページの内容を要約する「Extract」モデルと、RLトレーニング中のパフォーマンスを評価する「Judge」モデルを統合しています。このシステムは、検索API(例:SERPやJina)と連携して情報を収集・統合するエージェントワークフローとしてデプロイ可能です。

対象ユーザー

このプロジェクトは、マルチモーダルエージェント、LLMにおける深層研究能力、コンピュータビジョンと情報検索の交差点に取り組むAI研究者および開発者を対象としています。

主な特徴

  • マルチモーダル研究エージェント: 画像および動画を横断した深層研究が可能なMLLMを構築。
  • VDR-Bench: MLLM向けの視覚的およびテキスト検索の再考を促進する専用ベンチマーク。
  • 包括的なトレーニングツールキット: SFTおよびRLのコード、およびコールドスタート用・RL用のデータセットを含む。
  • 動画拡張: Video-DeepResearchにより、連続的な動画ストリームへの深層研究能力の拡張を実現。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト