bytedance/Lance

A 3B-active-parameter native unified multimodal model for image and video understanding, generation, and editing.

解决的问题

Lance 解决了创建一个能够处理多种多模态任务的单一高效模型的挑战。无需为不同需求使用独立的模型,它提供了一个统一的框架,用于图像和视频的理解、生成和编辑。

工作原理

Lance 是一个原生的统一多模态模型,拥有 30 亿个活跃参数。它基于分阶段多任务训练方案,从零开始训练,使用最多 128 块 A100 GPU。它支持广泛的任务,包括文本到图像(T2I)、文本到视频(T2V)、图像到视频(I2V)、图像/视频编辑以及视觉理解(图像描述和问答)。

适用人群

该项目主要是一个研究用的成果,面向研究统一多模态建模的研究人员和开发者,特别是那些希望在相对较小的模型规模和有限的计算预算下,实现图像和视频任务的高性能表现的人。

主要亮点

  • 统一能力:一个模型即可支持图像/视频的生成、编辑和理解。
  • 高效扩展:仅使用 30 亿活跃参数,同时在基准测试中保持竞争力。
  • 多功能任务支持:支持文本到视频(T2V)、图像到视频(I2V)、文本到图像(T2I)以及多轮一致性编辑。
  • 研究就绪:包含微调代码,并由 vLLM-Omni 支持。

相关

  • Dispatch
  • 项目
  • 项目
  • 项目
  • 项目