Correr-Zhou/OmniShow
OmniShow는 텍스트, 참조 이미지, 오디오, 자세 조건을 통합하여 인간이 물체와 상호작용하는 고해상도 영상을 생성하는 다중 모달 영상 생성 모델입니다.
EvoLinkAI/GPT-Image-2-Seedance-2.5-Workflow
GPT Image 2와 Seedance를 결합하여 스토리보드에서 고품질 AI 영상으로 생성하는, 엄선된 워크플로우와 프롬프트 템플릿의 컬렉션입니다.
zhouwei713/seedance-prompt
일반적인 설명 대신 현실의 촬영 장비와 인간의 미숙함을 세밀하게 시뮬레이션하여 'AI 느낌'을 제거하는 AI 비디오 생성용 프롬프트 프레임워크 및 기술입니다.
geekjourneyx/hyperframes-motion-director
텍스트 콘텐츠를 구조화된 모션 비디오 제작물로 변환하는 Agent Skill로, 계획 및 에셋 생성을 위한 전문적인 2단계 워크플로우를 특징으로 합니다.
nvidia-cosmos/cosmos-predict2.5
NVIDIA Cosmos‑Predict 2.5는 텍스트, 이미지 또는 비디오를 미래 상태의 비디오 예측으로 변환하는 오픈소스 확산 모델입니다. 2 B/14 B 체크포인트, 로봇 및 자율주행차 전용 변형, LoRA 미세조정, 증류, Hugging Face Diffusers 통합을 지원합니다. 물리적 AI(로봇공학, AV 시뮬레이션, 비디오 분석)를 위한 설계로, 자세한 문서, 사후학습 레시피북, Apache 2.0(코드) 및 NVIDIA Open Model License(가중치) 라이선스를 제공합니다.
madebyollin/taehv
TAEHV는 Hunyuan, MiniMax-H3, Wan-Video, CogVideoX, Open-Sora, LTX-2 등 많은 확산 모델용으로 작고 자동 인코더입니다. 동영상 VAE 디코딩을 가속화하고 메모리를 최적화합니다. 61프레임의 512×320 클립의 디코딩 시간을 약 2~3초 / 6~9GB에서 약 0.5초 / <0.5GB로 줄이며, 약간의 품질 희생이 있습니다. 리포지토리는 모델 체크포인트, Python API(`TAEHV`, `StreamingTAEHV`), 예제 노트북, ComfyUI, stable-diffusion.cpp, SDNext, Diffusers 통합 설명서를 포함합니다.
PKU-YuanGroup/Helios
Helios는 단일 H100 GPU에서 최대 19.5 FPS로 분 단위의 고품질 영상을 생성할 수 있는 14B 파라미터 실시간 장편 영상 생성 모델입니다.
microsoft/DCVC
청크 기반 코딩 프레임워크를 사용하여 높은 압축 효율과 빠른 인코딩/디코딩 속도를 달성하는 초고속 신경망 비디오 코덱.
wuwukaka/ComfyUI-WanAnimatePlus
ComfyUI의 WanVideo 파이프라인을 위한 확장 기능으로, 원활한 비디오 연결과 다중 참조 이미지를 주입하여 AI 비디오 생성의 일관성을 향상시킵니다.
google-deepmind/physics-IQ-benchmark
실제 세계 영상 데이터를 사용하여 생성형 비디오 모델의 물리적 이해력과 현실감을 평가하기 위한 고품질 벤치마크 데이터셋 및 워크플로우입니다.
EvoLinkAI/awesome-seedance-2.5-guide
Seedance 2.5의 공식 가이드 및 쇼케이스로, 고급 AI 동영상 생성을 위한 상세한 프롬프트와 API 예제를 제공합니다.
NVlabs/AnyFlow
AnyFlow는 고품질의 동영상 생성을 위해 임의의 추론 예산에 적응할 수 있는 임의 단계 동영상 확산 프레임워크입니다.
facebookresearch/mae_st
시공간 학습을 위한 마스크된 자동부호화기(MAE)의 PyTorch 구현으로, 마스크된 동영상 프레임을 재구성함으로써 동영상 표현을 학습할 수 있습니다.
MCG-NJU/VideoChat3
VideoChat3는 미세한 움직임과 장시간 추론, 라이브 스트림의 능동적 응답까지 포괄하는 4B 규모의 일반화된 영상 MLLM로, 효율적인 영상 이해를 위한 설계입니다.
Eyeline-Labs/Vista4D
Vista4D는 4D 포인트 클라우드를 사용하여 소스 영상에서 새로운 카메라 경로와 시점으로 동적 장면을 합성하는 비디오 리쇼트 프레임워크입니다.
microsoft/World-R1
World-R1은 기본 모델 아키텍처를 변경하지 않고 생성된 비디오를 3D 제약과 정렬함으로써 텍스트‑투‑비디오 생성에서 3D 기하학적 일관성을 향상시키는 강화 학습 프레임워크입니다.
SandAI-org/MAGI-1
MAGI-1은 자기 회귀 비디오 생성 모델로, 시간 일관성과 물리적 정확성을 보장하기 위해 청크 단위로 고충실도 비디오를 생성합니다.
linzzzzzz/openclip
긴 영상과 라이브 스트리밍에서 매력적인 하이라이트를 추출하고, 전사(transcription), AI 분석, 자막 및 커버가 포함된 자동 클립 생성을 제공하는 자동화된 AI 파이프라인입니다.
marcelo-earth/generative-manim
Generative Manim은 LLM(GPT‑4o, Claude, Gemini 등)을 사용하여 일반 영어 프롬프트를 실행 가능한 Manim 애니메이션 코드와 렌더링된 동영상으로 변환하는 오픈소스 도구입니다. 웹 데모, REST API, 로컬 렌더링용 데스크톱 앱(Animo)을 제공하며, 오픈웨이트 모델의 미세조정을 위한 훈련 파이프라인과 벤치마크 스위트도 포함합니다.
chenfengxu714/StreamDiffusionV2
단일 및 멀티 GPU 환경에서 처리량과 지연 시간을 최적화하는 실시간 스트리밍 동영상 생성을 위한 인터랙티브 확산 파이프라인입니다.
louisedesadeleer/clipify
긴 형식의 토킹 헤드 동영상을 자동 리프레이밍 및 자막 기능이 포함된 짧은 소셜 미디어용 클립으로 자동 변환하는 Claude Code 스킬입니다.
yaoyao-jpg/PhiZero
PhiZero는 결과를 비디오로 렌더링하기 전에 이산적인 Physical Language에서 추론함으로써 미래의 물리적 역학을 예측하는 월드 모델입니다.
Kosinkadink/ComfyUI-AnimateDiff-Evolved
무한한 길이와 모션 및 샘플링에 대한 광범위한 제어를 가능하게 하는 고급 AnimateDiff 통합으로, ComfyUI에서 고품질 AI 애니메이션을 생성할 수 있습니다.
WeChatCV/Stand-In
추가 파라미터의 1%만 훈련하여 높은 주제 일관성을 유지하는 경량이고 즉시 사용 가능한 정체성 보존 동영상 생성 프레임워크입니다.
Lixsp11/sekai-codebase
Sekai는 세계 탐험 및 생성을 위해 5,000시간 이상의 주석이 달린 1인칭 및 드론 영상을 특징으로 하는 고품질 에고센트릭(egocentric) 비디오 데이터셋입니다.
AMAP-ML/DreamX-World
DreamX-World는 이벤트 프롬프트를 통해 사용자가 환경을 탐색하고 변형할 수 있는 고해상도이고 제어 가능한 시뮬레이션을 생성하는 일반 목적의 인터랙티브 월드 모델입니다.
zju3dv/street_crafter
StreetCrafter는 제어 가능한 동영상 확산 모델과 3D 가우시안 스플래터링을 사용하여 새로운 경로에서 현실적인 동영상을 생성하는 프레임워크입니다.
Vchitect/Latte
고품질 비디오 생성을 위한 잠재 확산 트랜스포머로, 텍스트에서 비디오 및 텍스트에서 이미지 작업을 모두 지원합니다.
Orkas-AI/Orkas-VideoStudio
읽기 쉬운 계획 파일을 통해 AI 코딩 에이전트가 동영상을 구성, 편집, 생성할 수 있도록 하는 툴킷으로, 자동화된 동영상 제작을 위한 결정론적 파이프라인을 제공합니다.
thu-ml/DiT-Extrapolation
위치 임베딩 외삽(extrapolation)을 통해 더 긴 비디오와 더 높은 해상도의 이미지를 생성할 수 있게 하는 Diffusion Transformers용 플러그 앤 플레이 프레임워크입니다.
barefootford/buttercut
Final Cut Pro, Premiere, DaVinci Resolve와 같은 전문 소프트웨어용 XML 컷을 생성하는 AI 동영상 편집 에이전트로, 원본 영상의 초기 아셈블리 과정을 자동화합니다.
alibaba/Tora
Tora는 텍스트, 시각, 궤적 기반 가이드를 사용하여 객체의 움직임을 정밀하게 제어할 수 있는 궤적 중심 확산 변환기(Diffusion Transformer)입니다.
Kevin-thu/StoryMem
StoryMem은 메모리 조건부 확산 모델을 사용하여 일관된 캐릭터를 가진 긴, 연속적인 내러티브 영상을 생성하는 다중 샷 영상 생성 프레임워크입니다.
wernerturing/multi-delogo
자동 탐지 기능을 갖추고 있으며, 움직이는 로고도 처리할 수 있는 비디오 로고 및 워터마크 제거 애플리케이션.
ossrs/oryx
Oryx는 전사적 AI 기능을 통합한 라이브 스트리밍 및 WebRTC 서비스를 구축하기 위한 종합적인 오픈소스 비디오 솔루션입니다.
Agions/splicr
Rust 기반 AI 비디오 내레이션 엔진으로 멀티 에이전트 시스템을 사용하여 CapCut 내보내기를 위한 장면 분석, 대본 작성, 음성 클로닝 및 타임라인 정렬을 자동화합니다.
IgorShadurin/app.yumcut.com
TikTok, YouTube Shorts, Instagram Reels용 스크립트, 보이스오버, 비주얼, 자막을 자동 생성하는 오픈소스 AI 단편 비디오 생성기입니다.
NevermindNilas/TheAnimeScripter
애니메이션 전용 AI 기반 동영상 강화 툴킷으로, 한 번의 처리로 업스케일링, 프레임 보간, 복원을 제공합니다.
showlab/Kiwi-Edit
Kiwi‑Edit는 자연어 명령(및 선택 사항인 참조 이미지)을 사용하여 전체 비디오를 편집할 수 있는 오픈 소스 비디오 편집 시스템입니다. 멀티모달 LLM 인코더와 비디오 Diffusion Transformer를 결합하여 스타일 변환, 객체 추가/교체/제거 및 배경 변경 기능을 제공합니다. 이 저장소는 전체 학습 스크립트(Qwen2.5‑VL‑3B + Wan2.2‑TI2V‑5B를 사용한 3단계 커리큘럼 학습), 사전 학습된 Diffusers 체크포인트, 그리고 OpenVE‑Bench 및 RefVIE‑Bench에 대한 평가 파이프라인을 제공합니다.
Anil-matcha/Seedance-2-API
ByteDance의 Seedance AI 동영상 생성기용 Python 래퍼로, 현실적인 인간 얼굴과 캐릭터 일관성을 중시한 고해상도 텍스트-동영상 및 이미지-동영상 생성을 가능하게 합니다.
simchowitzlabpublic/nano-world-model
확산 강제 기반의 동영상 월드 모델 학습을 위한 최소한의 프레임워크로, 미래 동영상 예측, 3D 재구성, 로봇 계획에 사용 가능합니다.
microsoft/LatentSpatialMemory
3D 장면 콘텐츠를 잠재 토큰으로 저장하여 반복적인 RGB 렌더링을 피함으로써 생성 속도를 높이고 메모리 오버헤드를 줄이는 비디오 세계 모델용 프레임워크.
TencentARC/VerseCrafter
VerseCrafter는 4D 기하 제어와 GeoAdapter를 사용하여 현실적인 비디오에서 카메라와 다중 객체의 움직임에 대해 정밀하고 해석 가능한 제어를 제공하는 제어 가능한 비디오 월드 모델입니다.
nvidia-cosmos/cosmos-predict1
미래 상태 예측을 위한 세계 기반 모델(WFMs)의 세트로, 텍스트 또는 비디오 프롬프트에서 시각적 시뮬레이션을 생성하여 Physical AI 개발을 지원합니다.
Tencent-Hunyuan/HY-WorldPlay
HY-World 1.5는 사용자 입력을 기반으로 기하학적으로 일관된 3D 환경을 스트리밍 비디오 확산을 통해 실시간으로 생성하는 상호작용형 세계 모델링 프레임워크입니다.
Tencent-Hunyuan/HunyuanVideo-1.5
경량화된 8.3억 파라미터 비디오 생성 모델로, 소비자용 GPU에서도 고품질 텍스트‑투‑비디오 및 이미지‑투‑비디오 합성을 가능하게 합니다.
JingyunLiang/VRT
VRT는 동영상 슈퍼리졸루션, 디블러링, 노이즈 제거, 프레임 보간 및 공간-시간 SR을 처리하는 Transformer 기반 모델인 Video Restoration Transformer의 PyTorch 구현입니다. 시간적 상호 자기 주의(TMSA)와 병렬 왜곡을 사용하여 장거리 시간 의존성을 포착하며, 9개 벤치마크에서 최첨단 PSNR 성능을 달성합니다. 리포지토리에는 사전 학습된 가중치, 테스트 스크립트, Colab 데모, 표준 동영상 데이터셋에서의 학습 지침이 포함되어 있습니다.
caiyuanhao1998/Open-OmniVCus
OmniVCus는 깊이 및 마스크와 같은 다중 모달 제어 조건 하에서 특정 주제를 포함하는 동영상을 생성하는 피드포워드 주제 중심의 동영상 커스터마이징 프레임워크로, 확산 트랜스포머를 사용합니다.