tongjingqi/Thinking-with-Video
We introduce 'Thinking with Video', a new paradigm leveraging video generation for multimodal reasoning. Our VideoThinkBench shows that Sora-2 surpasses GPT5 by 10% on eyeballing puzzles and reaches 69% accuracy on MMMU.
解決的問題
本專案引入了「透過影片進行思考」(Thinking with Video),這是一種利用影片生成模型來解決複雜多模態問題的推理範式。其目標是透過使用動態影片生成來視覺化推理過程(如繪圖、想像與時間演變),從而克服基於靜態圖像的推理以及文本與視覺分離的局限性。
工作原理
本專案提出使用影片生成模型(如 Sora-2)透過生成代表解決方案步驟的影片来进行推理。為了評估這一點,作者創建了 VideoThinkBench,這是一個由以下部分組成的綜合基準測試:
- 以視覺為中心的任務:涉及空間推理(eyeballing puzzles)、模式識別(visual puzzles)、抽象推理(ARC-AGI-2)和路徑尋找(mazes)的挑戰。
- 以文本為中心的任務:改編自 GSM8K、MATH 和 MMLU 等既有基準測試的推理問題,模型必須將推理或答案嵌入到生成的影片幀中。
適用對象
這主要面向從事多模態 LLM、影片生成模型以及生成式 AI 與認知推理交叉領域研究的 AI 研究人員與開發人員。
亮點
- 全新的推理範式:將重點從「透過文本進行思考」(CoT)轉向「透過影片進行思考」。
- VideoThinkBench:第一個專門用於評估影片生成模型推理能力的基準測試。
- 具競爭力的性能:證明了影片生成模型在特定的以視覺為中心的任務(如 eyeballing puzzles)上可以超越最先進的視覺語言模型 (VLM)。
- 統一的模態:展示了影片模型可以在單一生成框架內同時處理基於文本的推理與視覺推理。
相關
- 專案
- 專案
- 專案
- 專案
- 專案