a312863063/Video-Auto-Wipe
자막과 로고와 같은 고정 패턴 콘텐츠를 자동으로 탐지하고 동영상에서 제거하는 도구.
qingmeng1/bilijump-ai
LLM 기반 자막 또는 오디오 분석을 사용하여 Bilibili 동영상의 광고 구간을 자동으로 감지하고 건너뛰는 Chrome/Firefox 확장 프로그램으로, 선택적 수동 건너뛰기, 사용자 편집 가능 광고 타임스탬프 및 사용자 정의 AI 엔드포인트 지원 기능을 제공합니다.
tomateo1reg/sora2-watermark-remover-web-gui
비디오를 업로드하고 GPU에서 딥러닝 워터마크 제거 모델을 실행한 후, 현대적인 브라우저 UI 또는 작은 REST API를 통해 정리된 비디오를 반환하는 Flask 기반 웹 앱.
okineadev/vitepress-plugin-llms
VitePress 플러그인으로 빌드 시 LLM 친화적인 Markdown 파일(`llms.txt` 및 `llms‑full.txt`)을 자동 생성하고, 복사/다운로드를 위한 선택적 UI 버튼을 제공하며, 사용자 정의 레이블, 다국어 설정, 특수 `<llm-only>` / `<llm-exclude>` 태그를 지원합니다.
joeseesun/qiaomu-cut-skill
텍스트 프롬프트를 재현 가능한 비디오 프로젝트로 변환하는 에이전트 네이티브 비디오 디렉터로, 자산 조달, 촬영 계획, ffmpeg 렌더링을 자동화합니다.
princepainter/ComfyUI-PainterI2V
Wan2.2용 ComfyUI 노드로, 이미지에서 동영상 생성 시 느린 움직임 문제를 해결하고 움직임의 진폭을 증가시키며 카메라 움직임 반응성을 향상시킵니다.
bytedance/vidi
비디오 이해 및 생성을 위한 대규모 멀티모달 모델(LMM) 제품군으로, 시간적 검색, 시공간 그라운딩, 자동 비디오 편집과 같은 작업을 가능하게 합니다.
OpenGVLab/VideoChat-Flash
VideoChat-Flash는 계층적 압축을 사용하여 최대 3시간 길이의 동영상을 효율적으로 이해할 수 있는 다중모달 대규모 언어 모델입니다.
daydreamlive/scope
자기회귀 확산 모델과 구성 가능한 아키텍처를 사용하여 실시간으로 상호작용 가능한 생성형 AI 비디오 파이프라인을 실행하고 사용자 정의할 수 있는 도구입니다.
amanchadha/iSeeBetter
공간-시간 동영상 슈퍼리졸루션 프로젝트로, 순환 생성적 백프로젝션 네트워크와 GAN을 사용하여 저해상도 동영상을 시간적 일관성과 세부 디테일을 유지하면서 확대합니다.
EternalEvan/Astra
Astra는 자기회귀 확산 트랜스포머를 사용하여 현실적인 동작 조건부 장기 비디오 예측을 생성하는 대화형 월드 모델입니다.
vargHQ/sdk
오픈소스 TypeScript SDK로, 개발자와 AI 에이전트가 선언형 JSX 구문과 통합 API를 사용해 여러 AI 제공업체용 AI 생성 비디오를 만들 수 있습니다.
jdh-algo/JoyVASA
JoyVASA는 diffusion 기반 프레임워크로, 오디오를 사용해 인간 및 동물 초상화를 애니메이션화하며 얼굴 정체성과 움직임을 분리해 고품질·장시간 비디오 생성을 가능하게 합니다.
gudaochangsheng/RefAlign
추론 단계의 오버헤드 없이 정체성 일관성과 참조 충실도를 개선하는 Reference-to-video 생성용 학습 단계 정렬 프레임워크.
EzioBy/Ditto
Ditto is a framework for generating high-quality synthetic video editing data to train Editto, a state-of-the-art instruction-based video editing model.
PKU-YuanGroup/ConsisID
ConsisID는 튜닝이 필요 없는 DiT 기반 텍스트‑투‑비디오 생성 모델로, 주파수 분해를 사용해 생성된 비디오 프레임 간에 일관된 인간 정체성을 유지합니다.
PKU-YuanGroup/MagicTime
MagicTime은 텍스트 프롬프트를 기반으로 현실적인 타임랩스 영상을 생성하여 눈에 띄는 물리적 변화를 묘사하는 메타모픽 비디오 생성 파이프라인입니다.
Tencent-Hunyuan/HunyuanVideo-I2V
정적 이미지를 고품질 비디오로 변환하는 이미지‑투‑비디오 생성 프레임워크로, 멀티모달 LLM을 사용해 의미 일관성을 유지합니다.
finnvoor/fx-upscale
macOS에서 Metal을 활용한 명령줄 도구를 통해 동영상 파일을 더 높은 해상도로 업스케일링.
Thmen/EGVSR
고품질 동영상 확대를 위한 추론 속도를 빠르게 하기 위해 서브픽셀 컨볼루션을 사용하는 효율적인 동영상 슈퍼리졸루션 프레임워크인 EGVSR의 PyTorch 구현.
apiframe-ai/seedance-2.0-api
ByteDance의 Seedance 2.0용 API 구현 및 예제 세트로, 텍스트, 이미지, 멀티모달 참조 기반의 비디오 생성과 동기화 오디오를 가능하게 합니다.
krusemediallc/arcads-claude-code
Arcads API를 통해 AI 기반 광고 크리에이티브(비디오, 이미지, 썸네일)를 생성하고 게시하기 위한 구체적인 Claude Code 스킬 팩입니다. 즉시 사용 가능한 프롬프트, 다단계 파이프라인(Pixar 스타일, 클레이메이션, UGC 등), 비용 추적 및 Meta 광고 게시 도우미가 포함되어 있습니다.
huggingface/llm.nvim
llm.nvim은 llm-ls 언어 서버를 통해 대규모 언어 모델을 호출하여 AI 기반 코드 완성(고스트 텍스트) 기능을 추가하는 Neovim 플러그인입니다. 여러 백엔드(Hugging Face Inference API, Ollama, OpenAI 호환 서버, Hugging Face TGI)를 지원하며, 모델의 컨텍스트 윈도우에 맞춰 프롬프트를 자동으로 트리밍합니다. 또한 파일별 활성화 설정, Fill-in-the-middle 지원 및 사용자 지정 요청 매개변수를 제공합니다.
DeepMyst/Mysti
Mysti는 12개의 코드 생성 AI 제공업체(Claude, Codex, Gemini, Copilot, Ollama, LocalAI 등)를 통합한 VS Code 확장 프로그램입니다. 멀티 에이전트 브레인스토밍, 개발자 페르소나, 안전 제어가 포함된 자율 실행, @-멘션 라우팅, 자동 컨텍스트 압축과 같은 협업 기능을 제공합니다. 확장 프로그램을 설치하고 최소 하나의 제공업체 CLI를 추가(브레인스토밍을 위해서는 두 개 설치)한 뒤 JSON 설정으로 구성하면 에디터 내에서 바로 AI 코딩을 시작할 수 있습니다.
Songssx/ComfyUI-MiniMaxH3-TimelineDirector
MiniMax H3로 임의의 길이의 동영상을 생성할 수 있는 ComfyUI 플러그인. 타겟 길이를 잠재 연속 세그먼트로 분할하고, 드리프트 제어 마스크를 적용하며, 잠긴 오디오 리프싱크를 지원하고, 내장된 이중 단계 SelfLift 샘플링을 통해 빠른 저해상도 + 고해상도 생성이 가능합니다. `ComfyUI/custom_nodes`에 클론하여 설치한 후, 마테리얼 플래너로 미디어를 배열하고 생성 윈도우를 설정한 후, Finite Segment Sampling 노드를 실행하여 시ーム리스한 MP4를 생성하세요.
vita-epfl/Stable-Video-Infinity
기본 비디오 모델 상의 LoRA 어댑터를 사용하여 높은 시간적 일관성과 제어 가능한 스토리라인을 갖춘 무한 길이의 비디오를 생성하기 위한 프레임워크입니다.
0xsline/StoryGen-Atelier
Gemini와 Vertex AI Veo를 사용하여 스토리보드를 생성하고 이를 일관된 영상으로 이어주는 AI 보조 도구.
sb2702/free-ai-video-upscaler
가입이나 소프트웨어 다운로드 없이 비디오 해상도를 높일 수 있는 무료 브라우저 기반 AI 비디오 업스케일러입니다.
google-deepmind/videoprism
VideoPrism은 Google‑DeepMind에서 오픈소스로 공개한 비디오 기초 모델(JAX/Flax)로, 사전 학습된 비디오 전용 및 비디오-텍스트 인코더를 제공합니다. 수십억 개의 이미지-텍스트 및 비디오-텍스트 쌍으로 학습된 고정된 백본은 대부분의 비디오 이해 벤치마크에서 최고 성능을 달성합니다. 리포지토리는 설치가 간편하고, 체크포인트 로딩 유틸리티, 세 가지 Colab 데모(비디오 인코딩, 크로스모달 검색, 분류 파인튜닝)를 제공합니다. 네 가지 모델 크기(기본/대형, 인코더 전용 또는 인코더+텍스트)가 Hugging Face에 호스팅되어 있으며, Apache 2.0/CC‑BY 라이선스로 제공됩니다.