Correr-Zhou/OmniShow

OmniShow 是一個統一文字、參考影像、音訊與姿態條件的多模態影片生成模型,可生成人類與物件互動的高保真影片。

EvoLinkAI/GPT-Image-2-Seedance-2.5-Workflow

一套精選的工作流程與提示範本,用於結合 GPT Image 2 與 Seedance,從故事板生成高品質 AI 影片。

zhouwei713/seedance-prompt

一種用於AI影片生成的提示框架與技能,透過以真實拍攝設備與人為不完美細節取代通用描述,消除「AI感」。

geekjourneyx/hyperframes-motion-director

一種將文本內容轉換為結構化動態影片製作物的 Agent Skill,具有用於規劃與資產生成的專業兩階段工作流。

nvidia-cosmos/cosmos-predict2.5

NVIDIA Cosmos‑Predict 2.5 是一個開源的擴散模型,可將文字、影像或影片轉換為未來狀態的影片預測。支援 2 B/14 B 檢查點,具備機器人與自動駕駛車專用變體、LoRA 微調、蒸餾功能,並與 Hugging Face Diffusers 集成。專為物理 AI(機器人、AV 模擬、影片分析)設計,提供詳細文件、後訓練配方菜譜,程式碼採用 Apache 2.0 授權,權重採用 NVIDIA Open Model License。

madebyollin/taehv

TAEHV 是一個極小的自動編碼器,可加速並優化多種擴散模型(Hunyuan、MiniMax-H3、Wan-Video、CogVideoX、Open-Sora、LTX-2 等)的影片 VAE 解碼。它將 61 幀 512×320 影片片段的解碼時間從約 2–3 秒 / 6–9 GB 降至約 0.5 秒 / <0.5 GB,僅帶來輕微畫質損失。倉儲包含模型檢查點、Python API(`TAEHV`、`StreamingTAEHV`)、範例筆記本,以及 ComfyUI、stable-diffusion.cpp、SDNext 和 Diffusers 的整合說明。

PKU-YuanGroup/Helios

Helios 是一個擁有 14B 參數的即時長影片生成模型,在單塊 H100 GPU 上即可生成分鐘級、高畫質的影片,幀率高達 19.5 FPS。

microsoft/DCVC

一種超快速的神經影片編解碼器,採用基於分塊的編碼框架,實現高壓縮效率與極快的編解碼速度。

wuwukaka/ComfyUI-WanAnimatePlus

ComfyUI WanVideo 流程的擴充功能,可實現無縫影片連接與多重參考圖注入,以提升 AI 影片生成的連貫性。

google-deepmind/physics-IQ-benchmark

一個高品質的基準資料集與工作流程,使用真實世界影像來評估生成式視頻模型的物理理解與真實感。

EvoLinkAI/awesome-seedance-2.5-guide

Seedance 2.5 的官方指南與展示,提供高階 AI 影片生成的詳細提示與 API 範例。

NVlabs/AnyFlow

AnyFlow 是一個任意步數動畫擴散框架,可讓單一模型適應任意推論預算以實現高品質動畫生成。

facebookresearch/mae_st

一種用於時空學習的 PyTorch 實作的遮罩自編碼器,使模型能透過重建被遮罩的影片畫格來學習影片表示。

MCG-NJU/VideoChat3

VideoChat3 是一個 4B 參數的通用視頻 MLLM,專為高效視頻理解而設計,涵蓋從微小動作到長影片推理,再到即時串流主動回應的全部能力。

Eyeline-Labs/Vista4D

Vista4D 是一個影片重拍框架,使用 4D 點雲從原始影片中透過新相機軌跡與視角合成動態場景。

microsoft/World-R1

World-R1 是一個強化學習框架,透過在不改變基礎模型架構的前提下,將產生的影片與 3D 約束對齊,提升文字生成影片的 3D 幾何一致性。

SandAI-org/MAGI-1

MAGI-1 是一種自回歸影片生成模型,透過逐段產生高保真影片,以確保時間一致性與物理精準度。

linzzzzzz/openclip

一個自動化的 AI 流水線,能從長影片與直播中提取提取吸引人的精彩片段,並提供逐字稿、AI 分析以及帶有字幕與封面圖的自動剪輯生成功能。

marcelo-earth/generative-manim

Generative Manim 是一個開源工具,使用 LLM(GPT‑4o、Claude、Gemini 等)將自然語言提示轉換為可執行的 Manim 動畫程式碼和渲染影片。它提供 Web 演示、REST API 和本地渲染的桌面應用(Animo),還包含用於微調開源權重模型以生成 Manim 程式碼的訓練流程和基準測試套件。

chenfengxu714/StreamDiffusionV2

一種用於即時串流影片生成的互動式擴散管道,可在單GPU與多GPU設定中優化吞吐量與延遲。

louisedesadeleer/clipify

一個 Claude Code 技能,能自動將長篇說話頭部影片轉換為簡短且適合社群平台的短片,並具備自動重新構圖與字幕功能。

yaoyao-jpg/PhiZero

PhiZero 是一種世界模型,透過在離散的物理語言中進行推理,再將結果渲染為影片,預測未來的物理動態。

Kosinkadink/ComfyUI-AnimateDiff-Evolved

一個為 ComfyUI 提供的高階 AnimateDiff 整合,可實現高品質 AI 動畫的無限長度生成,並對運動與採樣具有廣泛控制能力。

WeChatCV/Stand-In

透過僅訓練 1% 的額外參數,保持高主體一致性的輕量級、即插即用身份保留型影片生成框架。

Lixsp11/sekai-codebase

Sekai 是一個高品質的自我中心(egocentric)影片數據集,包含超過 5,000 小時的已標註第一人稱與無人機視角影片,用於世界探索與生成。

AMAP-ML/DreamX-World

DreamX-World 是一個通用的互動式世界模型,能生成高保真、可控制的模擬環境,讓使用者透過事件提示探索與轉變環境。

zju3dv/street_crafter

StreetCrafter 是一個利用可控制影片擴散模型與 3D 高斯點陣從新軌跡生成逼真影片的框架。

Vchitect/Latte

一種用於高品質影片生成的潛在擴散 Transformer,支援文字到影片與文字到影像任務。

Orkas-AI/Orkas-VideoStudio

一個使 AI 編碼代理能透過可讀的計畫檔案組合、編輯與生成影片的工具包,為自動化影片製作提供決定性流程。

thu-ml/DiT-Extrapolation

一個用於 Diffusion Transformers 的即插即用框架,透過位置嵌入外推法實現更長的影片與更高解析度的圖像生成。

barefootford/buttercut

一個能為 Final Cut Pro、Premiere 和 DaVinci Resolve 等專業軟體生成 XML 剪輯的 AI 影片編輯代理,可自動化完成素材的初始組裝。

alibaba/Tora

Tora 是一種面向軌跡的擴散變換器,可透過文字、視覺與軌跡引導,精確控制物件運動,實現高品質影片生成。

Kevin-thu/StoryMem

StoryMem 是一個使用記憶條件化擴散模型生成長篇、連貫敘事影片的多鏡頭影片生成框架,可保持角色一致性。

wernerturing/multi-delogo

一款用於移除影片中商標與水印的應用程式,具備自動偵測功能,可處理移動的商標。

ossrs/oryx

Oryx 是一個整合 AI 功能(如字幕生成與配音)的全功能開源影片解決方案,用於建構直播串流與 WebRTC 服務。

Agions/splicr

一個基於 Rust 的 AI 影片旁白引擎,使用多代理系統自動化場景分析、腳本撰寫、語音克隆和時間軸對齊,以供 CapCut 匯出。

IgorShadurin/app.yumcut.com

一個開源的 AI 短影片生成器,可自動化生成 TikTok、YouTube Shorts 與 Instagram Reels 所需的腳本、配音、視覺與字幕。

NevermindNilas/TheAnimeScripter

專為動畫設計的AI驅動影片增強工具包,可在單次處理中實現放大、運動插值與修復。

showlab/Kiwi-Edit

Kiwi‑Edit 是一個開源的影片編輯系統,透過自然語言指令(以及可選的參考圖像)來修改整個影片。它將多模態 LLM 編碼器與影片 Diffusion Transformer 融合,提供風格轉移、物件新增/替換/移除以及背景變更功能。該儲存庫提供了完整的訓練腳本(包含使用 Qwen2.5‑VL‑3B + Wan2.2‑TI2V‑5B 的三階段課程學習)、預訓練的 Diffusers 權重,以及在 OpenVE‑Bench 和 RefVIE‑Bench 上的評估流程。

Anil-matcha/Seedance-2-API

ByteDance 的 Seedance AI 影片生成器的 Python 封裝,支援高保真度的文字到影片與影像到影片生成,重點實現真實人類臉部與角色一致性。

simchowitzlabpublic/nano-world-model

基於擴散強制的極簡框架,用於訓練視頻世界模型,適用於未來視頻預測、3D 重建與機器人規劃。

microsoft/LatentSpatialMemory

一個用於視訊世界模型的框架,將 3D 場景內容儲存為潛在表示,透過避免重複的 RGB 渲染來提升生成速度並減少記憶體開銷。

TencentARC/VerseCrafter

VerseCrafter 是一個可控影片世界模型,透過 4D 幾何控制與 GeoAdapter,為真實影片中的相機與多物件運動提供精確且可解釋的控制。

nvidia-cosmos/cosmos-predict1

一套專為未來狀態預測設計的世界基礎模型,能從文字或影片提示生成視覺模擬,以支援 Physical AI 的開發。

Tencent-Hunyuan/HY-WorldPlay

HY-World 1.5 是一個即時互動式世界建模框架,利用串流影片擴散技術,根據使用者輸入生成幾何一致的 3D 環境。

Tencent-Hunyuan/HunyuanVideo-1.5

一個輕量級的 8.3 億參數影片生成模型,能在消費級 GPU 上實現高品質的文字轉影片與圖像轉影片合成。

JingyunLiang/VRT

VRT 是影片修復Transformer(VRT)的PyTorch實作,一種基於Transformer的模型,可處理影片超解析度、去模糊、去雜訊、幀插值與時空超解析度。它採用時間互相關自注意力與平行變形機制,捕捉長程時間依賴性,在九個基準測試中實現最頂尖PSNR提升。倉儲包含預訓練權重、測試腳本、Colab示範以及標準影片資料集的訓練說明。

caiyuanhao1998/Open-OmniVCus

OmniVCus 是一個前饋式主題驅動的影片客製化框架,利用擴散Transformer在深度與遮罩等多模態控制條件下生成特定主題的影片。