bytedance/Bernini

Bernini is a unified framework for video generation and editing that combines an MLLM-based semantic planner with a DiT-based renderer.

What it solves

Bernini 解決了高品質影片生成與編輯的挑戰,特別是提升了指令遵循與語義一致性。它旨在提供一個統一的框架,透過在實際渲染過程之前規劃語義變化,來處理複雜的編輯指令。

How it works

該框架由兩個主要組件組成:

  1. Semantic Planner: 基於 MLLM (Multimodal Large Language Model) 的規劃器,負責將複雜指令分解並規劃必要的語義變化。
  2. Renderer: 基於 DiT (Diffusion Transformer) 的渲染器,負責執行視覺生成。

根據使用者的需求,該專案提供了兩種模型系列:用於強化指令遵循能力的完整 Bernini 管線 (Planner + Renderer),以及用於更簡單配置與強大渲染一致性的 Bernini-R (Renderer-only)。

Who it’s for

對於在影片擴散模型與 AI 驅動的影片編輯領域工作的研究人員與開發者,且需要對視覺變化進行精確控制並獲得高品質輸出時,非常適合使用。

Highlights

  • Unified Framework: 支援多種任務,包括 text-to-video (t2v), image-to-video (i2v), video-to-video (v2v) 等。
  • High Performance: 在影片編輯基準測試中,表現達到領先的閉源商業模型第一梯隊。
  • Flexible Model Options: 提供完整的規劃管線與獨立的渲染器 (提供 1.3B 與 14B 版本)。
  • Prompt Enhancement: 包含一個可選的提示詞增強器,可透過 OpenAI-compatible 接口進行使用,以提升生成品質。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案