yizhi-chengzi/video-ai-talking

想做真人口播,又不必自己对着镜头念。上传一段真人出镜视频,写好字幕,本机配音并对口型,合成竖屏 MP4。密钥只留在浏览器里。

video-ai-talking – AI 기반 '실제 사람' 토크헤드 영상 생성기

무엇인가요

  • 로컬에서 실행되는 웹 앱으로, 사람 얼굴의 침묵 영상을 전체 길이의 토크헤드 영상으로 변환합니다. 스크립트를 직접 입력하거나 DeepSeek를 통해 자동 생성할 수 있습니다. 앱은 합성 음성 생성, Alibaba Bailian VideoRetalk를 사용한 리프싱크, FFmpeg를 통한 배경 영상 및 자막 추가를 통해 최종 영상을 조합합니다.

왜 중요한가요

  • 오디오 녹음이나 수동 리프싱크 편집 없이도 크리에이터가 토크헤드 영상을 쉽게 제작할 수 있습니다. 모든 처리는 귀하의 컴퓨터에서 이루어지며, 클라우드 서버에 키나 미디어가 저장되지 않습니다.

주요 구성 요소

구성 요소 역할 제공자
텍스트에서 음성 음성 생성 Alibaba Bailian CosyVoice 또는 Volcengine (ByteDance) TTS
리프싱크 음성과 얼굴 움직임 동기화 Alibaba Bailian VideoRetalk
스크립트 생성 (옵션) 주제로부터 내레이션 자동 생성 DeepSeek LLM
영상 조합 얼굴 영상, 생성된 음성, 선택적 BGM 및 추가 영상 통합, 자막/타이틀 추가 FFmpeg (로컬)

필요한 것들

  • Node 20+ 및 정상 작동하는 FFmpeg/ffprobe 설치.
  • 사용할 서비스의 API 자격 증명:
    • Bailian VideoRetalk (리프싱크에 필수)
    • Bailian CosyVoice 또는 Volcengine TTS (음성)
    • DeepSeek (옵션, AI 기반 스크립트 생성)
  • 단일 인물의 앞면을 향한 짧은 영상 (음성은 필요 없음).

시작 방법

# 복제 및 설치
git clone https://github.com/yizhi-chengzi/video-ai-talking.git
cd video-ai-talking
cp .env.example .env
npm install

# 개발 모드 (http://127.0.0.1:5175에서 열림)
npm run dev
  • 웹 UI 열기, 설정 패널에 API 키 입력 후 연결 테스트.
  • "토크헤드" 클립을 드래그 앤 드롭, 원하는 배경 영상 추가, TTS 음성 선택, 스크립트를 직접 작성하거나 AI가 생성하도록 설정.
  • 자막/스킨 스타일 선택 후 생성 시작 클릭. 파이프라인 실행: TTS → VideoRetalk → FFmpeg → 최종 MP4.
  • 완성된 영상은 라이브러리 패널에 표시되어 미리보기, 다운로드, 삭제 가능.

로컬 데이터 처리

  • API 키는 브라우저의 localStorage에만 저장되며, 원격 서버로 전송되지 않습니다.
  • 모든 중간 파일 (JSON 작업 설명, 원본 오디오, 리프싱크 영상, 최종 MP4)은 프로젝트의 data/ 폴더 내에 저장됩니다.
  • VideoRetalk가 일시적으로 필요로 하는 업로드 파일은 Alibaba의 OSS에 약 48시간 저장된 후 삭제됩니다.

일반적인 사용 흐름

  1. 설정 – Bailian VideoRetalk 키 입력; TTS 제공자 선택 및 자격 증명 입력.
  2. 소스 영상 로드 – 명확한 앞면 영상의 발표자 클립.
  3. 자산 추가 – 선택적 BGM 또는 전체 화면 컷인 영상.
  4. 스크립트 생성 – 수동 입력 또는 DeepSeek가 자동 생성 (길이, 주제 선택).
  5. 스킨 선택 – 자막 스타일, 제목 표시 여부 등 선택.
  6. 생성 – 앱이 음성, 리프싱크 영상, 최종 MP4를 한 번에 생성.
  7. 검토 – 라이브러리에서 재생 또는 다운로드; 필요 시 재생성.

개발 및 테스트

  • npm test는 모든 외부 서비스를 모킹한 단위 테스트를 실행합니다.
  • npm run typecheck는 TypeScript 타입을 검사합니다.
  • VAT_MOCK=1을 설정하면 TTS, VideoRetalk, DeepSeek를 오프라인 실험용으로 모킹할 수 있습니다.

안전성 및 라이선스

  • MIT 라이선스이지만, DISCLAIMER.md, SECURITY.md, privacy.md를 참조하여 사용 시 주의사항 확인 (예: 얼굴 데이터는 리프싱크를 위해 일시적으로 Bailian에 업로드됨).
  • README에 표시된 데모 영상은 무료로 사용 가능한 스톡 라이브러리에서 가져온 것으로, 본 도구의 실제 사용자 영상이 아닙니다.

결론: video-ai-talking은 최신 TTS, 리프싱크, 영상 합성 기술을 결합하면서도 모든 데이터를 귀하의 컴퓨터에 보관하는 실용적이고 자체 호스팅 가능한 AI 보조 토크헤드 영상 생성 도구입니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트