linyqh/NarratoAI
利用 AI 大模型,一键解说并剪辑视频
해결하는 문제
NarratoAI는 영화 및 TV 프로그램 해설 영상을 제작하기 위한 원스톱 자동화 도구입니다. 스크립트 작성, 영상 클립 편집, 음성 생성 및 자막 추가에 드는 수동 작업을 제거하여 크리에이터의 전체 콘텐츠 제작 프로세스를 간소화합니다.
작동 방식
이 도구는 대규모 언어 모델(LLM)을 사용하여 스크립트를 작성하고 영상 콘텐츠를 이해합니다. 파이프라인의 각 단계에 따라 다양한 AI 엔진을 통합합니다:
- 스크립트 작성 및 분석: LLM(DeepSeek R1/V3 또는 Qwen2-VL 등)과 영상 이해 백엔드(TwelveLabs Pegasus 등)를 사용하여 영상을 분석하고 해설 스크립트를 생성합니다.
- 오디오: 음성 생성(TTS) 엔진(IndexTTS, OmniVoice, Tencent Cloud TTS 등)을 사용하여 음성을 생성하며, 보이스 클로닝을 지원합니다.
- 오디오/음악: Sonilo AI를 통합하여 동일한 영상 콘텐츠와 편집 리듬에 기반한 배경 음악을 생성합니다.
- 오디오/비디오 동기화: 자막 및 클리핑 프로세스를 자동화하며, CapCut 초안으로 내보내기를 지원합니다.
대상 사용자
영화/TV 프로그램 요약 및 숏폼 드라마 해설 영상 제작을 실제로 자동화하고자 하는 콘텐츠 크리에이터, 소셜 미디어 인플루언서 및 영상 편집자.
주요 특징
- 원스톱 파이프라인: 스크립트 작성, 클리핑, 음성 및 자막을 단일 워크플로우에서 자동화합니다.
- 영상 이해: Qwen2-VL 및 TwelveLabs Pegasus와 같은 고급 모델을 지원하여 네이티브 영상 분석이 가능합니다.
- 멀티모달 AI: LLM, TTS 및 AI 생성 음악(Sonilo AI)을 결합하여 완전한 시청각 경험을 제공합니다.
- 보이스 클로닝: 개인화된 오디오를 위해 로컬 보이스 클로닝 엔진(IndexTTS, OmniVoice)을 지원합니다.
- 멀티모달 통합: 최종 수동 편집을 위한 CapCut 초안 내보내기를 지원합니다。
- 크로스 플랫폼: Windows 및 macOS(Apple Silicon)용 통합 패키지로 제공됩니다.