Vincentwei1021/video-talkcraft

Agent skill that turns Claude Code / Codex into a motion-design studio for voiceover-driven explainer videos — word-level voiceover sync, 109 motion recipe cards, an anti-slideshow camera system, Remotion rendering.

해결하는 문제

video-talkcraft는 스크립트와 보이스오버 녹음을 고품질, 모션 그래픽이 풍부한 타이핑 헤드 영상으로 변환합니다. 텍스트와 오디오를 수동으로 동기화하거나, 복잡한 애니메이션을 설계하거나, 교육용, 제품 리뷰, 뉴스 해설 영상의 시각적 레이아웃 안전성을 보장하는 수작업을 모두 제거합니다.

작동 방식

Claude Code 또는 Codex용으로 설계된 AI 에이전트 스킬로서, 프로덕션 파이프라인을 조율합니다.

  1. 오디오 동기화: FireRedASR2-CTC 또는 faster-whisper와 같은 ASR 백엔드를 사용하여 스크립트의 문자 수준 타임스탬프를 생성합니다.
  2. 샷 디자인: 에이전트는 스크립트를 분석하여 78개의 모션 레시피 카드 라이브러리를 기반으로 "SHOTBOOK"(스토리보드)을 생성합니다.
  3. Remotion 구현: Remotion 프레임워크를 사용하여 React 기반의 동영상 코드를 작성하여 동적 텍스트 카드, B-roll, 카메라 이동을 렌더링합니다.
  4. 품질 보증: 자동 스크립트를 사용하여 정지 프레임, 오디오 에너지 수준, 시간적 결함을 확인하는 삼중 검증 시스템입니다.

대상 사용자

교육용, 리뷰용, 설명 영상 등을 제작하며 전통적인 소프트웨어에서 수동 편집 없이 프로페셔널한 모션 그래픽을 원하는 콘텐츠 크리에이터, 교육자, 리뷰어.

주요 특징

  • 문자 수준 동기화: 고정밀 오디오-텍스트 동기화 (중앙값 편차 20–40ms).
  • 78개의 모션 레시피 카드: 다양한 시각 효과를 위한 자체 완결형 Remotion tsx 소스 코드 라이브러리.
  • Anti-PPT 시스템: 7단계 모델을 통해 지속적인 카메라 곡선과 파라랄랙스 평면을 보장하여 정지 프레임을 방지합니다.
  • 자동 레이아웃 안전성: OpenCV YuNet을 사용하여 얼굴 경계 상자 감지하고, 요소가 화자 얼굴을 가리지 않도록 보장합니다.
  • 삼중 검증: 정지 프레임, 사운드 이펙트 트리거, 프레임 그룹 리뷰를 자동으로 확인하여 프로페셔널한 완성도를 보장합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트