ChrisChen667788/wind-comic
Multi-agent AI pipeline that turns one line of text into a finished short-form drama: script, cinematic storyboards, character-consistent video. Provider-agnostic (OpenAI/Claude, MJ, Minimax, Veo/Sora, fal, ComfyUI). MIT.
해결하는 문제
대부분의 AI 비디오 도구는 단일 프롬프트에서 짧고 단절된 클립만 생성합니다. Wind Comic은 단 한 줄의 텍스트를 스크립트, 캐릭터 바이블, 스토리보드, 보이스오버 및 최종 MP4 파일이 포함된 완전하고 응집력 있는 숏폼 드라마로 변환하여 엔드 투 엔드 제작 문제를 해결합니다.
작동 방식
이 시스템은 전문 에이전트(Writer, Director, Character Designer 등)가 엄격한 일관성 계약을 통해 작업을 전달하는 정직한 멀티 에이전트 파이프라인을 사용합니다. 워크플로우는 Text $ ightarrow$ JSON $ ightarrow$ PNG $ ightarrow$ IMG $ ightarrow$ MP4의 구조화된 단계를 따릅니다. 프로세스에는 특정 임계값 미만의 샷을 자동으로 다시 생성하는 "Vision-Audit" 재시도 루프와 여러 비디오 엔진이 최고의 클립을 제공하기 위해 경쟁하는 "multi-engine race"가 포함됩니다.
대상 사용자
- 숏폼 드라마 크리에이터: 트로프(cliché)를 인식한 글쓰기와 클리프행어 감지를 원하는 제작자.
- 콘텐츠 마케팅 팀: 세련된 30초 광고 전반에 걸쳐 일관된 캐릭터가 필요한 팀.
- 인디 영화 제작자: 멀티 트랙 타임라인과 시네마토그래피 제어가 필요한 제작자.
- 만화 각색 스튜디오: 스크립트를 일관된 아트 스타일의 스토리보드로 변환해야 하는 스튜디오.
- 오픈 소스 빌더: 자체 LLM(OpenAI, Anthropic, DeepSeek, Ollama 등)을 연결하고자 하는 개발자.
주요 특징
- 멀티 에이전트 오케스트레이션: Director, Writer, Editor와 같은 전문화된 역할 포함.
- 캐릭터 일관성: 얼굴 기하학적 구조와 아이덴티티 DNA를 고정하는 "Character Studio"를 통해 구현.
- 엔드 투 엔드 립싱크: viseme 키프레임 트랙과 입 모양-오디오 정렬 스코어링 제공.
- 디렉터 컨트롤 룸: 멀티 트랙 타임라인과 시네마토그래피 제어 기능 제공.
- BYO LLM 지원: 간단한 환경 변수를 통한 사용자 LLM 지원.
- 자동 품질 루프: 품질이 저하된 샷의 재렌더링 및 영상 상태 감사를 위한 자동화된 루프.