bytedance/Bernini
Bernini is a unified framework for video generation and editing that combines an MLLM-based semantic planner with a DiT-based renderer.
What it solves
Bernini는 고품질 비디오 생성 및 편집의 과제, 특히 지시어 준수 및 시맨틱 일관성을 개선하는 문제를 해결합니다. 실제 렌더링 프로세스 이전에 시맨틱 변화를 계획함으로써 복잡한 편집 지시를 처리할 수 있는 통합 프레임워크를 제공하는 것을 목표로 합니다.
How it works
이 프레임워크는 두 가지 주요 구성 요소로 구성됩니다:
Semantic Planner: 복잡한 지시어를 분해하고 필요한 시맨틱 변화를 계획하는 MLLM 기반 (Multimodal Large Language Model) 플래너.
Renderer: 시각적 생성을 실행하는 DiT 기반 (Diffusion Transformer) 렌더러.
사용자의 요구 사항에 따라, 이 프로젝트는 두 가지 모델 제품군을 제공합니다: 더 강력한 지시어 준수 능력을 위한 전체 Bernini 파이프라인 (Planner + Renderer), 그리고 더 간단한 설정과 강력한 렌더링 일관성을 위한 Bernini-R (Renderer-only).
Who it’s for
시각적 변화에 대한 정밀한 제어와 고품질 출력을 필요로 하는 비디오 확산 모델 및 AI 기반 비디오 편집 분야의 연구자와 개발자.
Highlights
- Unified Framework: text-to-video (t2v), image-to-video (i2v), video-to-video (v2v) 등을 포함한 여러 작업을 지원합니다.
- High Performance: 비디오 편집 벤치마크에서 선도적인 폐쇄형 상용 모델과 동등한 첫 번째 티어에 도달했습니다.
- Flexible Model Options: 전체 계획 파이프라인과 독립형 렌더러 (1.3B 및 14B 변형 제공)를 모두 제공합니다.
- Prompt Enhancement: 생성 품질을 향상시키기 위해 OpenAI-compatible 엔드포인트를 통한 선택적 프롬프트 강화 기능을 포함합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트