bytedance/Bernini

Bernini is a unified framework for video generation and editing that combines an MLLM-based semantic planner with a DiT-based renderer.

What it solves

Berniniは、高品質なビデオ生成と編集における課題、特に指示への追従性とセマンティックな一貫性を解決します。実際のレンダリングプロセスが始まる前にセマンティックな変化を計画することで、複雑な編集指示を処理できる統合フレームワークを提供することを目指しています。

How it works

このフレームワークは、主に2つのコンポーネントで構成されています:

  1. Semantic Planner: 複雑な指示を分解し、必要なセマンティックな変化を計画するMLLMベース (Multimodal Large Language Model) のプランナー。

  2. Renderer: 視覚的な生成を実行するDiTベース (Diffusion Transformer) のレンダラー。

ユーザーのニーズに応じて、本プロジェクトは2つのモデルファミリーを提供しています:より強力な指示追従性を持つ完全版 Bernini パイプライン (Planner + Renderer)、および、よりシンプルなセットアップと強力なレンダリング一貫性を持つ Bernini-R (Renderer-only)。

Who it’s for

ビデオ拡散モデルおよびAI駆動のビデオ編集に取り組む研究者や開発者で、視覚的な変化を精密に制御し、高品質な出力を求める方々。

Highlights

  • Unified Framework: text-to-video (t2v), image-to-video (i2v), video-to-video (v2v) を含む、複数のタスクをサポート。

  • High Performance: ビデオ編集ベンチマークにおいて、主要なクローズドソースの商用モデルと並ぶ第一梯隊に到達しています。

  • Flexible Model Options: 完全なプランニング・パイプラインと、スタンドアロンのレンダラー (1.3B および 14B バリアント) の両方を提供。

  • Prompt Enhancement: 生成品質を向上させるため、OpenAI-compatible なエンドポイントを介したオプションのプロンプト・エンハンサーが含まれています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト