zenstory-ai/video-recap-skills
Clip any video into a narration recap with claude code skill|用 claude code skill 把任何视频剪辑成中文解说视频,支持剪映导出
해결하는 문제
이 프로젝트는 긴 동영상을 중국어로 음성 설명이 포함된 요약 영상으로 자동 변환하는 파이프라인을 제공합니다. AI 에이전트가 콘텐츠 이해부터 최종 조립까지 전반적인 창작 과정을 처리함으로써 수동적인 동영상 편집, 스크립트 작성, 음성 녹음 제작의 필요성을 제거합니다.
작동 방식
이 시스템은 Claude Code, Codex CLI, OpenCode, OpenClaw와 같은 AI 에이전트 호스트에 통합할 수 있는 '스킬' 세트로 작동합니다. 워크플로우는 다음과 같은 단계를 따릅니다:
- 이해: Xiaomi MiMo API를 통해 ASR(자동 음성 인식)과 VLM(시각-언어 모델)을 사용하여 장면을 분석하고 텍스트를 추출하며 콘텐츠 개요를 생성합니다.
- 계획: 에이전트가 감독 및 편집자 역할을 하여 스토리 플랜, 시각/오디오 보드, 최종 내레이션 스크립트를 만듭니다.
- 편집: 시스템은 동영상을 먼저 자르고 편집된 타임라인을 기반으로 스크립트를 작성하거나, 스크립트를 먼저 작성한 후에 자르는 방식 중 하나를 선택할 수 있습니다.
- 내레이션: Xiaomi MiMo 또는 Fish Audio TTS를 사용하여 고품질 내레이션을 생성합니다.
- 조립:
ffmpeg를 사용하여 편집된 동영상, 내레이션, 배경 음악, 자막을 결합하여 최종 MP4 파일을 생성합니다. 또한 CapCut(剪映)에서 수동으로 세부 조정할 수 있는 스키마 기반 드래프트도 내보낼 수 있습니다.
대상 사용자
전문 편집 소프트웨어나 GPU 기반의 고성능 로컬 하드웨어가 필요 없이 빠르게 동영상 요약 또는 리캡을 생성하고 싶은 콘텐츠 크리에이터, 소셜 미디어 매니저, 사용자에게 적합합니다.
주요 특징
- 로컬 GPU 필요 없음: ASR, VLM, TTS의 모든 중량 작업은 API를 통해 처리되며, 로컬에서는 Python과
ffmpeg만 필요합니다. - 에이전트 기반 워크플로우: 단순한 기계적 요약이 아니라, 시점과 주요 스토리라인과 같은 창의적 결정을 AI가 관리합니다.
- CapCut 통합: CapCut에 편집 가능한 드래프트를 내보내 수동으로 세부 조정이 가능합니다.
- 다중 동영상 지원: 여러 소스 동영상을 하나의 스토리로 합성할 수 있으며, 로컬 자료 라이브러리의 분석 결과를 재사용하여 비용을 절감할 수 있습니다.
- 유연한 TTS: Xiaomi MiMo 및 Fish Audio 등 다양한 제공업체를 지원하며, 사용자 정의 음성 클론도 가능합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트