yizhi-chengzi/video-ai-talking
想做真人口播,又不必自己对着镜头念。上传一段真人出镜视频,写好字幕,本机配音并对口型,合成竖屏 MP4。密钥只留在浏览器里。
video-ai-talking – AI 기반 '실제 사람' 토크헤드 영상 생성기
무엇인가요
- 로컬에서 실행되는 웹 앱으로, 사람 얼굴의 침묵 영상을 전체 길이의 토크헤드 영상으로 변환합니다. 스크립트를 직접 입력하거나 DeepSeek를 통해 자동 생성할 수 있습니다. 앱은 합성 음성 생성, Alibaba Bailian VideoRetalk를 사용한 리프싱크, FFmpeg를 통한 배경 영상 및 자막 추가를 통해 최종 영상을 조합합니다.
왜 중요한가요
- 오디오 녹음이나 수동 리프싱크 편집 없이도 크리에이터가 토크헤드 영상을 쉽게 제작할 수 있습니다. 모든 처리는 귀하의 컴퓨터에서 이루어지며, 클라우드 서버에 키나 미디어가 저장되지 않습니다.
주요 구성 요소
| 구성 요소 | 역할 | 제공자 |
|---|---|---|
| 텍스트에서 음성 | 음성 생성 | Alibaba Bailian CosyVoice 또는 Volcengine (ByteDance) TTS |
| 리프싱크 | 음성과 얼굴 움직임 동기화 | Alibaba Bailian VideoRetalk |
| 스크립트 생성 (옵션) | 주제로부터 내레이션 자동 생성 | DeepSeek LLM |
| 영상 조합 | 얼굴 영상, 생성된 음성, 선택적 BGM 및 추가 영상 통합, 자막/타이틀 추가 | FFmpeg (로컬) |
필요한 것들
- Node 20+ 및 정상 작동하는 FFmpeg/ffprobe 설치.
- 사용할 서비스의 API 자격 증명:
- Bailian VideoRetalk (리프싱크에 필수)
- Bailian CosyVoice 또는 Volcengine TTS (음성)
- DeepSeek (옵션, AI 기반 스크립트 생성)
- 단일 인물의 앞면을 향한 짧은 영상 (음성은 필요 없음).
시작 방법
# 복제 및 설치
git clone https://github.com/yizhi-chengzi/video-ai-talking.git
cd video-ai-talking
cp .env.example .env
npm install
# 개발 모드 (http://127.0.0.1:5175에서 열림)
npm run dev
- 웹 UI 열기, 설정 패널에 API 키 입력 후 연결 테스트.
- "토크헤드" 클립을 드래그 앤 드롭, 원하는 배경 영상 추가, TTS 음성 선택, 스크립트를 직접 작성하거나 AI가 생성하도록 설정.
- 자막/스킨 스타일 선택 후 생성 시작 클릭. 파이프라인 실행: TTS → VideoRetalk → FFmpeg → 최종 MP4.
- 완성된 영상은 라이브러리 패널에 표시되어 미리보기, 다운로드, 삭제 가능.
로컬 데이터 처리
- API 키는 브라우저의
localStorage에만 저장되며, 원격 서버로 전송되지 않습니다. - 모든 중간 파일 (JSON 작업 설명, 원본 오디오, 리프싱크 영상, 최종 MP4)은 프로젝트의
data/폴더 내에 저장됩니다. - VideoRetalk가 일시적으로 필요로 하는 업로드 파일은 Alibaba의 OSS에 약 48시간 저장된 후 삭제됩니다.
일반적인 사용 흐름
- 설정 – Bailian VideoRetalk 키 입력; TTS 제공자 선택 및 자격 증명 입력.
- 소스 영상 로드 – 명확한 앞면 영상의 발표자 클립.
- 자산 추가 – 선택적 BGM 또는 전체 화면 컷인 영상.
- 스크립트 생성 – 수동 입력 또는 DeepSeek가 자동 생성 (길이, 주제 선택).
- 스킨 선택 – 자막 스타일, 제목 표시 여부 등 선택.
- 생성 – 앱이 음성, 리프싱크 영상, 최종 MP4를 한 번에 생성.
- 검토 – 라이브러리에서 재생 또는 다운로드; 필요 시 재생성.
개발 및 테스트
npm test는 모든 외부 서비스를 모킹한 단위 테스트를 실행합니다.npm run typecheck는 TypeScript 타입을 검사합니다.VAT_MOCK=1을 설정하면 TTS, VideoRetalk, DeepSeek를 오프라인 실험용으로 모킹할 수 있습니다.
안전성 및 라이선스
- MIT 라이선스이지만,
DISCLAIMER.md,SECURITY.md,privacy.md를 참조하여 사용 시 주의사항 확인 (예: 얼굴 데이터는 리프싱크를 위해 일시적으로 Bailian에 업로드됨). - README에 표시된 데모 영상은 무료로 사용 가능한 스톡 라이브러리에서 가져온 것으로, 본 도구의 실제 사용자 영상이 아닙니다.
결론: video-ai-talking은 최신 TTS, 리프싱크, 영상 합성 기술을 결합하면서도 모든 데이터를 귀하의 컴퓨터에 보관하는 실용적이고 자체 호스팅 가능한 AI 보조 토크헤드 영상 생성 도구입니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트