HAKORADev/VODER
Voice Operation and Design Engine with Reproduction capabilities
해결하는 문제
VODER는 당신의 컴퓨터에 완전히 로컬로 오프라인으로 작동하는 프로페셔널급 음성 처리 툴킷입니다. 8가지 핵심 오디오 모드—음성 인식(STT), 음성 합성(TTS), 음성 변환(VC), 음악 생성, 음성 강화, 사운드 효과, 보컬 분리, 화자 다이어라이제이션—을 하나의 명령줄 인터페이스로 통합하여 별도의 도구나 클라우드 구독이 필요 없도록 합니다. 또한 다중 화자 녹음, 노이즈가 많은 오디오, 언어 장벽 등의 문제를 해결하기 위해 화자 분리, 더빙, 임의의 언어 간 번역 기능을 제공합니다.
작동 방식
VODER는 단일 CLI를 통해 여러 오픈소스 AI 모델을 조율합니다. python voder.py tts 또는 stt와 같은 하나의 명령어를 입력하면 해당 모델로 라우팅됩니다: 음성 인식은 Whisper, 음성 합성 및 클론은 Qwen3-TTS와 Fish Audio S2-Pro, 음성 변환은 Seed-VC, 음악 생성은 ACE-Step, 사운드 효과는 TangoFlux, 음성 강화는 UniSE, 다이어라이제이션은 pyannote를 사용합니다. 또한 YouTube, TikTok 등 다양한 플랫폼의 URL을 스마트하게 수신하고, 동영상임을 확인한 후 자동으로 다운로드하는 입력 파이프라인을 갖추고 있습니다. 8가지 모드 외에도 세 가지 작업 계층이 기능을 확장합니다: train은 재사용 가능한 음성 클론을 .tts/.ttse 파일로 저장하고, quest는 URL 다운로드 및 오디오 조작과 같은 가벼운 보조 작업을 제공하며, chains는 여러 작업을 사용자 정의 파이프라인으로 연결할 수 있게 합니다(예: 음악 생성 → 보컬 분리 → 음성 학습 → 동영상 더빙). 별도의 Project Eva DLC는 Flux 2 Dev와 MiniMax H3 등의 모델을 사용해 텍스트에서 이미지 생성, 텍스트에서 동영상 생성(음성 포함), 동영상 편집, 3D 세계 생성, 그리고 로컬 채팅(VADAR)을 가능하게 하며, 각각 독립된 환경에서 실행됩니다.
대상 사용자
VODER는 콘텐츠 제작자, 팟캐스트 제작자, 영상 편집자, 음악가, 성우, 그리고 클라우드 비용이나 개인정보 희생 없이 프로페셔널한 오디오 처리가 필요한 모든 사람들을 대상으로 합니다. CLI 사용자뿐 아니라 GUI(사용 가능)를 선호하는 사용자도 적합합니다. 모든 모드가 CPU에서 작동하므로 전용 GPU가 없어도 이용 가능하지만, GPU가 있으면 처리 속도가 향상됩니다.
주요 특징
- 하나의 도구에서 8가지 주요 처리 모드: TTS, STS(음성 변환), TTM(음악), STT(음성 인식), SE(강화), SFX(사운드 효과), SVS(보컬 분리), SS(화자 분리).
- 스크립트 지시어를 통한 다중 화자 대화 시스템: 각 라인의 타이밍, 볼륨, 지속 시간 조절, 내장 사운드 효과, 자동 배경 음악 지원.
- 음성 디자인 및 클론: 일반적인 영어로 음성 설명하거나 참조 클립에서 클론 생성, 동일한 대화 내에서 둘을 혼합 가능.
- 언어 변환 및 더빙: 원본 화자의 음성을 유지한 채 음성을 번역하고, 비디오용 세그먼트 단위 타이밍 정렬 자동 처리.
- 스마트한 입력 파이프라인: YouTube, TikTok, Bilibili, Snapchat, Instagram, Facebook, X/Twitter의 URL을 붙여넣기만 하면 자동 다운로드 가능. 이미지 업로드 시 OCR도 지원.
- 작업 계층:
train은 재사용 가능한 음성 클론을 .tts/.ttse 파일로 저장,quest는 미디어 조작 유틸리티 제공,chains는 사용자 정의 파이프라인 조합 가능. - Project Eva DLC는 텍스트에서 이미지 생성, 텍스트에서 동영상 생성(음성 포함), 동영상 편집, 3D 세계 생성, 비제한 로컬 채팅(VADAR)을 확장 — 모두 동일한 CLI 패턴으로 사용 가능.
- 오프라인 작동, CPU 또는 GPU에서 실행 가능, 외부 종속성은 FFmpeg만 필요.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트