cclank/lanshu-create-ai-presenter-video
Provider-neutral Codex Skill for producing verified AI presenter videos from a script and an authorized presenter image.
해결하는 문제
이 프로젝트는 AI 기반 디지털 인간 발표자 영상 제작을 위한 일반화된 워크플로우를 제공합니다. 주제나 스크립트, 그리고 사람의 참조 이미지를 입력으로 받아, 디지털 아바타가 텍스트를 말하며 입모양이 음성과 동기화되고, 자막과 시각 효과가 포함된 완전히 편집된 영상을 자동으로 생성합니다.
작동 방식
이 시스템은 Codex용 '스킬'로 작동하며, 특정 서비스 제공자에 종속되지 않고 음성 생성, 영상 생성, 입모양 동기화 등의 여러 AI 기능을 조율합니다. 프로세스는 오디오 트랙 기반의 엄격한 타임라인에 따라 진행됩니다:
- 준비 단계: 스크립트와 라이선스된 참조 이미지를 입력합니다.
- 생성 단계: 전체 오디오 오버를 생성하며, 이는 전체 영상의 마스터 타임라인으로 사용됩니다.
- 제작 단계: 디지털 인간 영상을 생성하여 오디오와 입모양이 정확히 동기화되도록 합니다.
- 후처리 단계: 자막, 키워드 애니메이션, 커버를 추가한 후 FFmpeg를 사용해 최종 영상을 렌더링합니다.
- 품질 보증 단계: 최종 마스터와 공유 버전을 출력하기 전에 오디오-비주얼 정합성과 품질을 기술적 및 수동 검사로 확인합니다.
대상 사용자
여러 AI 도구를 수동으로 조율하지 않고도 전문적인 품질의 디지털 인간 발표 영상을 제작하고 싶은 Codex 호환 에이전트 환경의 콘텐츠 제작자 및 사용자입니다.
주요 특징
- 프로바이더 중립성: 특정 모델이나 사설 API에 종속되지 않으며, 현재 환경에서 사용 가능한 도구를 자유롭게 활용할 수 있습니다.
- 오디오 중심 타임라인: 전체 오디오 오버를 주 타임라인으로 사용하여 입모양 드리프트를 방지하고 원활한 전환을 보장합니다.
- 자동화된 파이프라인: 스크립트 정리, 오디오 오버 생성, 편집, 렌더링, 품질 보증 보고서까지 모든 과정을 자동으로 처리합니다.
- 안전성 및 비용 제어: 이미지/음성 라이선스 확인 및 유료 생성 전 비용 추정을 내장된 체크 기능으로 지원합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트