tongjingqi/Thinking-with-Video

We introduce 'Thinking with Video', a new paradigm leveraging video generation for multimodal reasoning. Our VideoThinkBench shows that Sora-2 surpasses GPT5 by 10% on eyeballing puzzles and reaches 69% accuracy on MMMU.

해결하는 문제

이 프로젝트는 비디오 생성 모델을 사용하여 복잡한 멀티모달 문제를 해결하는 추론 패러다임인 "Thinking with Video"를 소개합니다. 이는 동적 비디오 생성을 사용하여 그리기, 상상, 시간적 진화와 같은 추론 과정을 시각화함으로써 정적 이미지 기반 추론 및 텍스트와 시각의 분리로 인한 한계를 극복하는 것을 목표로 합니다.

작동 방식

이 프로젝트는 해결 단계의 비디오를 생성함으로써 비디오 생성 모델(Sora-2와 같은)을 사용하여 추론을 수행하는 방식을 제안합니다. 이를 평가하기 위해 저자들은 다음과 같이 구성된 포괄적인 벤치마크인 VideoThinkBench를 만들었습니다:

  • 시각 중심 과제: 공간 추론(eyeballing puzzles), 패턴 인식(visual puzzles), 추상 추론(ARC-AGI-2), 경로 찾기(mazes)와 관련된 도전 과제.
  • 텍스트 중심 과제: GSM8K, MATH, MMLU와 같은 기존 벤치마크에서 가져온 추론 문제로, 모델은 생성된 비디오 프레임 내에 추론 또는 정답을 포함해야 합니다.

대상

이 프로젝트는 주로 멀티모달 LLM, 비디오 생성 모델, 그리고 생성형 AI와 인지 추론의 교차점에서 연구하는 AI 연구자 및 개발자를 위한 것입니다.

주요 특징

  • 새로운 추론 패러다임: "Thinking with Text" (CoT)에서 "Thinking with Video"로 초점을 전환합니다.
  • VideoThinkBench: 비디오 생성 모델의 추론 능력을 평가하기 위한 최초의 전용 벤치마크.
  • 경쟁력 있는 성능: 비디오 생성 모델이 eyeballing puzzles와 같은 특정 시각 중심 과제에서 최첨단 시각-언어 모델(VLM)을 능가할 수 있음을 보여줍니다.
  • 통합된 모달리티: 비디오 모델이 단일 생성 프레임워크 내에서 텍스트 기반 추론과 시각적 추론을 모두 처리할 수 있음을 보여줍니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트