ATH-MaaS/Pixelle-Video
🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine
해결하는 문제
Pixelle-Video는 단일 주제 또는 키워드로부터 완전한 영상을 제작할 수 있는 자동 숏폼 영상 엔진입니다. 수동 스크립트 작성, 이미지 생성, 나레이션 합성 및 영상 편집의 필요성을 제거하여, 편집 경험이 전혀 없는 사람도 전문가 수준의 숏폼 콘텐츠를 만들 수 있도록 합니다.
작동 방식
이 프로젝트는 모듈형 파이프라인을 사용하여 텍스트를 다음 4가지 주요 단계를 통해 영상으로 변환합니다:
- 스크립트 생성: LLM(GPT, DeepSeek, Qwen 등)이 사용자의 주제를 바탕으로 영상 스크립트를 생성합니다.
- 비주얼 플래닝: 시스템이 스크립트의 각 세그먼트에 필요한 이미지를 계획합니다.
- 프레임 처리: AI 모델이 비주얼 에셋을 생성합니다. 이는 ComfyUI 워크플로우, RunningHub 또는 이미지 및 영상을 위한 OpenAI, DashScope, Kling AI와 같은 제공업체에 대한 직접 API 호출을 통해 수행될 수 있습니다.
- 영상 합성: 시스템은 생성된 비주얼, 합성 음성(Edge-TTS 또는 Index-TTS와 같은 TTS 엔진 사용), 배경 음악을 레이아웃 및 스타일을 위한 HTML 기반 템플릿을 사용하여 최종 영상으로 결합합니다.
대상 사용자
- 콘텐츠 크리에이터: 수동 편집 없이 숏폼 영상을 빠르게 제작하고자 하는 사람.
- AI 애호가: 다양한 AI 모델(LLM, 이미지/영상 생성, TTS)을 단일 자동 워크플로우에 통합하고자 하는 사용자.
- 개발자: ComfyUI 워크플로우 또는 HTML 템플릿을 사용하여 영상 생성 파이프라인을 커스텀하고자 하는 사람.
주요 특징
- 완전 자동화: 단일 프롬프트로 스크립트, 이미지, 영상 및 오디오를 생성합니다.
- 유연한 모델 통합: 광범위한 LLM(Ollama, GPT, DeepSeek) 및 미디어 모델(Wan 2.1, Kling, DashScope)을 지원합니다.
- 모듈형 아키텍처: 사용자가 TTS 엔진, 이미지 생성기 및 영상 템플릿을 교체할 수 있습니다.
- 멀티모달 기능: 디지털 휴먼 토킹 헤드, image-to-video 생성 및 모션 트랜스퍼를 위한 고급 모듈을 포함합니다.
- 커스텀 가능한 스타일: 다양한 영상 방향(세로, 가로, 정사각형) 및 비주얼 스타일에 맞는 다양한 HTML 템플릿을 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트