bytedance/Bernini

Bernini is a unified framework for video generation and editing that combines an MLLM-based semantic planner with a DiT-based renderer.

What it solves

Bernini 解决了高质量视频生成与编辑的挑战,特别是提升了指令遵循与语义一致性。它旨在提供一个统一的框架,通过在实际渲染过程之前规划语义变化,来处理复杂的编辑指令。

How it works

该框架由两个主要组件:

  1. Semantic Planner: 基于 MLLM (Multimodal Large Language Model) 的规划器,负责将复杂的编辑指令分解并规划必要的语义变化。
  2. Renderer: 基于 DiT (Diffusion Transformer) 的渲染器,负责执行视觉生成。

根据用户的需求,该项目提供了两种模型系列:用于强化指令遵循能力的完整 Bernini 管线 (Planner + Renderer),以及用于更简单配置与强劲渲染一致性的 Bernini-R (Renderer-only)。

Who it’s for

对于在视频扩散模型与 AI 驱动的视频编辑领域工作的研究人员与开发者,且需要对视觉变化进行精确控制并获得高质量输出时,非常适合使用。

Highlights

  • Unified Framework: 支持多种任务,包括 text-to-video (t2v), image-to-video (i2v), video-to-video (v2v) 等。
  • High Performance: 在视频编辑基准测试中,表现达到领先的闭源商业模型第一梯队。
  • Flexible Model Options: 提供完整的规划管线与独立的渲染器 (提供 1.3B 与 14B 版本)。
  • Prompt Enhancement: 包含一个可选的提示词增强器,可通过 OpenAI-compatible 接口进行使用,以提升生成质量。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目