tongjingqi/Thinking-with-Video

We introduce 'Thinking with Video', a new paradigm leveraging video generation for multimodal reasoning. Our VideoThinkBench shows that Sora-2 surpasses GPT5 by 10% on eyeballing puzzles and reaches 69% accuracy on MMMU.

解決する課題

このプロジェクトは、ビデオ生成モデルを使用して複雑なマルチモーダル問題を解決する推論パラダイム「Thinking with Video」を導入します。これは、動的なビデオ生成を使用して、描画、想像、時間的進化などの推論プロセスを可視化することにより、静止画ベースの推論やテキストと視覚の分離による制限を克服することを目指しています。

仕組み

このプロジェクトは、解決策のステップを表すビデオを生成することで、ビデオ生成モデル(Sora-2など)を使用して推論を行う手法を提案しています。これを評価するために、著者は以下の要素からなる包括的なベンチマーク VideoThinkBench を作成しました:

  • 視覚中心タスク: 空間推論(eyeballing puzzles)、パターン認識(visual puzzles)、抽象推論(ARC-AGI-2)、経路探索(mazes)を含む課題。
  • テキスト中心タスク: GSM8K、MATH、MMLUなどの既存のベンチマークから適応させた推論問題。モデルは推論または回答を生成されたビデオフレーム内に埋め込む必要があります。

対象者

主に、マルチモーダルLLM、ビデオ生成モデル、および生成AIと認知推論の交差点に取り組んでいるAI研究者や開発者向けです。

ハイライト

  • 新しい推論パラダイム: 「Thinking with Text」(CoT) から「Thinking with Video」へと焦点を移します。
  • VideoThinkBench: ビデオ生成モデルの推論能力を評価するための初の専用ベンチマーク。
  • 競争力のあるパフォーマンス: ビデオ生成モデルが、eyeballing puzzlesのような特定の視覚中心タスクにおいて、最先端の視覚言語モデル(VLM)を凌駕できることを示しています。
  • 統一されたモダリティ: ビデオモデルが、単一の生成フレームワーク内でテキストベースの推論と視覚的推論の両方を処理できることを示しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト