Agents365-ai/video-podcast-maker
Topic → 4K narrated video for coding agents. v4.0: all TTS via the ttsCN engine component (11 platforms incl. MiniMax voice clone, native word-level subtitle sync), manifest-based Asset Engine, Remotion composition, cost-gated AI generation
해결하는 문제
간단한 주제를 전문적인 4K 동영상 팟캐스트로 변환하는 복잡한 과정을 자동화합니다. 수동적인 리서치, 스크립트 작성, 음성 녹음, 영상 편집이 필요 없으며, 여러 AI 도구를 하나의 파이프라인으로 조율함으로써 이를 해결합니다.
작동 방식
사용자는 코드 에이전트(예: Claude Code)에 주제를 제공하면, 이후 다단계 워크플로우를 조율합니다:
- 연구 및 스크립트 작성: 에이전트가 주제를 조사하고 내레이션 스크립트(
podcast.txt)를 생성합니다. - 오디오 생성:
ttscn브리지로 11개의 지원되는 TTS 백엔드(OpenAI, Azure, ElevenLabs 등) 중 하나를 사용해 음성 합성합니다. - 시각적 구성: Remotion을 활용해 AI 생성된 정지 이미지, B-롤, 오버레이를 통합하여 영상 구성합니다.
- 렌더링: FFmpeg를 통해 네이티브 자막과 배경 음악을 믹스하여 4K로 최종 출력물을 렌더링합니다.
- 최적화: 긴 형식 콘텐츠에서 9:16 세로형 짧은 영상으로 생성하고, YouTube, Bilibili, TikTok 등 플랫폼에 맞게 포맷을 조정할 수 있습니다.
대상 사용자
영상 편집이나 오디오 엔지니어링에 깊은 기술이 필요 없이 빠르게 고품질 동영상 콘텐츠를 제작하고 싶은 콘텐츠 크리에이터 및 팟캐스터입니다.
주요 특징
- 광범위한 TTS 지원: 11개의 다양한 텍스트 음성 엔진을 통합하여 다양한 목소리 옵션을 제공합니다.
- 4K 제작: Remotion을 통해 React 기반 자막을 사용해 고해상도 영상 렌더링합니다.
- 다중 플랫폼 대응: Bilibili, YouTube, Xiaohongshu, Douyin, WeChat Channels 등에 맞춰 출력 및 게시 정보를 맞춤화합니다.
- 자산 통합: 스톡 영상, AI 생성 정지 이미지, B-롤용 다양한 AI 엔진과 연결합니다.
- 발음 제어: 글로벌 및 프로젝트별 음소 사전을 포함하여 TTS의 잘못된 발음을 수정할 수 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트