tongjingqi/Thinking-with-Video
We introduce 'Thinking with Video', a new paradigm leveraging video generation for multimodal reasoning. Our VideoThinkBench shows that Sora-2 surpasses GPT5 by 10% on eyeballing puzzles and reaches 69% accuracy on MMMU.
解决的问题
本项目引入了“通过视频进行思考”(Thinking with Video),这是一种利用视频生成模型来解决复杂多模态问题的推理范式。其目标是通过使用动态视频生成来可视化推理过程(如绘图、想象和时间演变),从而克服基于静态图像的推理以及文本与视觉分离的局限性。
工作原理
本项目提出使用视频生成模型(如 Sora-2)通过生成代表解决方案步骤的视频来进行推理。为了评估这一点,作者创建了 VideoThinkBench,这是一个由以下部分组成的综合基准测试:
- 以视觉为中心的任务:涉及空间推理(eyeballing puzzles)、模式识别(visual puzzles)、抽象推理(ARC-AGI-2)和路径寻找(mazes)的挑战。
- 以文本为中心的任务:改编自 GSM8K、MATH 和 MMLU 等现有基准测试的推理问题,模型必须将推理或答案嵌入到生成的视频帧中。
适用对象
这主要面向从事多模态 LLM、视频生成模型以及生成式 AI 与认知推理交叉领域研究的 AI 研究人员和开发人员。
亮点
- 全新的推理范式:将重点从“通过文本进行思考”(CoT)转向“通过视频进行思考”。
- VideoThinkBench:第一个专门用于评估视频生成模型推理能力的基准测试。
- 极具竞争力的性能:证明了视频生成模型在特定的以视觉为中心的任务(如 eyeballing puzzles)上可以超越最先进的视觉语言模型 (VLM)。
- 统一的模态:展示了视频模型可以在单个生成框架内同时处理基于文本的推理和视觉推理。
相关
- 项目
- 项目
- 项目
- 项目
- 项目