bytedance/vidi

The official repo for "Vidi: Large Multimodal Models for Video Understanding and Editing"

解决的问题

Vidi 解决了全面的视频理解和创作挑战。它为从精确的时间检索(根据文本查询在视频中查找特定时间范围)、时空定位(在特定时间范围内定位对象)到高级视频分析和自动编辑的各种任务提供了一个统一的框架。

工作原理

Vidi 是专为视频理解与编辑 (VUE) 设计的大规模多模态模型 (LMM) 系列。它处理视频输入以执行多个不同的操作:

  • 理解:可以通过检索识别特定片段、在对象周围绘制边界框(定位)、生成章节标题、识别精彩片段以及回答有关视频内容的问题 (VQA/Thinking)。
  • 创作:通过其“Vidi-Edit”功能,模型可以接收多个上传的视频,并自动生成包含故事情节、音乐和特效的编辑后的视频。
  • 评估:该项目包含多个基准测试 (VUE-PLOT, VUE-STG, VUE-TR-V2),用于衡量情节理解、时空定位和时间检索方面的性能。

适用对象

  • AI 研究人员:从事多模态模型、视频分析和自动视频编辑工作的人员。
  • 开发者:希望将高级视频检索和定位功能集成到应用程序中的用户。
  • 内容创作者:需要视频摘要、精彩片段提取和编辑自动化工具的人员。

亮点

  • 多任务能力:支持定位、检索、分章节、精彩片段提取和 VQA。
  • 自动编辑:能够从原始片段生成包含音乐和特效的完整编辑视频。
  • 全面的基准测试:为时空定位和情节理解提供专门的评估集。
  • 模型权重:提供带有微调代码的 Vidi-7B 和 Vidi1.5-9B 模型。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • Dispatch