chengyi-ai/native-subtitle-quote-image
保留视频内嵌字幕,精确取帧并生成 3:4 社交长图的 Agent Skill
해결하는 문제
이 프로젝트는 동영상 프레임에서 고품질의 3:4 소셜 미디어 인용 이미지를 자동으로 생성합니다. Instagram이나 X와 같은 플랫폼에서 수동으로 캡처하고, 자르고, 포맷하는 번거로움을 해결하며, 시각적으로 매력적인 레이아웃을 유지하면서도 어색한 여백이나 과도한 자막 바를 피하는 전문적이고 컴팩트한 스타일을 보장합니다.
작동 방식
이 도구는 AI 에이전트에 통합할 수 있는 "에이전트 기술"로 작동합니다. 로컬 동영상 또는 온라인 동영상(yt-dlp을 통해)을 프레임 추출 → 자막 위치 조정 → 렌더링의 워크플로우로 처리합니다. 두 가지 다른 모드를 제공합니다:
- 네이티브 모드: 동영상의 원본 픽셀을 유지하며, 이미 프레임에 '버너 인'된 자막을 그대로 사용합니다. OCR 또는 재그리싱을 수행하지 않습니다.
- 스크립트 모드: JSON 스크립트에서 검증된 텍스트를 실제 동영상 프레임에 렌더링하여 후처리 자막임을 명확히 표시합니다.
시스템은 이미지 조작에 Pillow, 정밀한 프레임 추출에 FFmpeg(imageio-ffmpeg를 통해)을 사용합니다. 제공된 줄 수에 따라 메인 이미지와 자막 바 간의 비율을 자동 조정하는 레이아웃 엔진을 포함합니다.
대상 사용자
- 동영상 하이라이트를 공유 가능한 인용 카드로 변환하고 싶은 콘텐츠 크리에이터 및 소셜 미디어 매니저.
- 에이전트에 동영상에서 이미지로의 처리 기능을 추가하고 싶은 AI 에이전트 개발자.
- 동영상 기반 스토리텔링에 일관성 있고 컴팩트한 시각 스타일이 필요한 사용자.
주요 특징
- 이중 자막 모드: 네이티브 버너 인 자막과 스크립트 기반 오버레이를 엄격히 분리하여 진정성을 유지합니다.
- 에이전트 호환: Codex와 같은 호환 가능한 AI 에이전트에서 즉시 사용 가능한 플러그 앤 플레이 기술로 제공됩니다.
- 자동 워크플로우:
yt-dlp을 통한 URL 가져오기부터 최종 시각 품질 보증(QA)까지 모든 과정을 지원합니다. - 컴팩트 레이아웃 엔진: 메인 이미지의 강조와 자막 바 사이의 낭비된 공간을 최소화하는 특정 디자인 규칙을 구현합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트