Correr-Zhou/OmniShow
OmniShow 是一個統一文字、參考影像、音訊與姿態條件的多模態影片生成模型,可生成人類與物件互動的高保真影片。
EvoLinkAI/GPT-Image-2-Seedance-2.5-Workflow
一套精選的工作流程與提示範本,用於結合 GPT Image 2 與 Seedance,從故事板生成高品質 AI 影片。
zhouwei713/seedance-prompt
一種用於AI影片生成的提示框架與技能,透過以真實拍攝設備與人為不完美細節取代通用描述,消除「AI感」。
geekjourneyx/hyperframes-motion-director
一種將文本內容轉換為結構化動態影片製作物的 Agent Skill,具有用於規劃與資產生成的專業兩階段工作流。
nvidia-cosmos/cosmos-predict2.5
NVIDIA Cosmos‑Predict 2.5 是一個開源的擴散模型,可將文字、影像或影片轉換為未來狀態的影片預測。支援 2 B/14 B 檢查點,具備機器人與自動駕駛車專用變體、LoRA 微調、蒸餾功能,並與 Hugging Face Diffusers 集成。專為物理 AI(機器人、AV 模擬、影片分析)設計,提供詳細文件、後訓練配方菜譜,程式碼採用 Apache 2.0 授權,權重採用 NVIDIA Open Model License。
madebyollin/taehv
TAEHV 是一個極小的自動編碼器,可加速並優化多種擴散模型(Hunyuan、MiniMax-H3、Wan-Video、CogVideoX、Open-Sora、LTX-2 等)的影片 VAE 解碼。它將 61 幀 512×320 影片片段的解碼時間從約 2–3 秒 / 6–9 GB 降至約 0.5 秒 / <0.5 GB,僅帶來輕微畫質損失。倉儲包含模型檢查點、Python API(`TAEHV`、`StreamingTAEHV`)、範例筆記本,以及 ComfyUI、stable-diffusion.cpp、SDNext 和 Diffusers 的整合說明。
PKU-YuanGroup/Helios
Helios 是一個擁有 14B 參數的即時長影片生成模型,在單塊 H100 GPU 上即可生成分鐘級、高畫質的影片,幀率高達 19.5 FPS。
microsoft/DCVC
一種超快速的神經影片編解碼器,採用基於分塊的編碼框架,實現高壓縮效率與極快的編解碼速度。
wuwukaka/ComfyUI-WanAnimatePlus
ComfyUI WanVideo 流程的擴充功能,可實現無縫影片連接與多重參考圖注入,以提升 AI 影片生成的連貫性。
google-deepmind/physics-IQ-benchmark
一個高品質的基準資料集與工作流程,使用真實世界影像來評估生成式視頻模型的物理理解與真實感。
EvoLinkAI/awesome-seedance-2.5-guide
Seedance 2.5 的官方指南與展示,提供高階 AI 影片生成的詳細提示與 API 範例。
NVlabs/AnyFlow
AnyFlow 是一個任意步數動畫擴散框架,可讓單一模型適應任意推論預算以實現高品質動畫生成。
facebookresearch/mae_st
一種用於時空學習的 PyTorch 實作的遮罩自編碼器,使模型能透過重建被遮罩的影片畫格來學習影片表示。
MCG-NJU/VideoChat3
VideoChat3 是一個 4B 參數的通用視頻 MLLM,專為高效視頻理解而設計,涵蓋從微小動作到長影片推理,再到即時串流主動回應的全部能力。
Eyeline-Labs/Vista4D
Vista4D 是一個影片重拍框架,使用 4D 點雲從原始影片中透過新相機軌跡與視角合成動態場景。
microsoft/World-R1
World-R1 是一個強化學習框架,透過在不改變基礎模型架構的前提下,將產生的影片與 3D 約束對齊,提升文字生成影片的 3D 幾何一致性。
SandAI-org/MAGI-1
MAGI-1 是一種自回歸影片生成模型,透過逐段產生高保真影片,以確保時間一致性與物理精準度。
linzzzzzz/openclip
一個自動化的 AI 流水線,能從長影片與直播中提取提取吸引人的精彩片段,並提供逐字稿、AI 分析以及帶有字幕與封面圖的自動剪輯生成功能。
marcelo-earth/generative-manim
Generative Manim 是一個開源工具,使用 LLM(GPT‑4o、Claude、Gemini 等)將自然語言提示轉換為可執行的 Manim 動畫程式碼和渲染影片。它提供 Web 演示、REST API 和本地渲染的桌面應用(Animo),還包含用於微調開源權重模型以生成 Manim 程式碼的訓練流程和基準測試套件。
chenfengxu714/StreamDiffusionV2
一種用於即時串流影片生成的互動式擴散管道,可在單GPU與多GPU設定中優化吞吐量與延遲。
louisedesadeleer/clipify
一個 Claude Code 技能,能自動將長篇說話頭部影片轉換為簡短且適合社群平台的短片,並具備自動重新構圖與字幕功能。
yaoyao-jpg/PhiZero
PhiZero 是一種世界模型,透過在離散的物理語言中進行推理,再將結果渲染為影片,預測未來的物理動態。
Kosinkadink/ComfyUI-AnimateDiff-Evolved
一個為 ComfyUI 提供的高階 AnimateDiff 整合,可實現高品質 AI 動畫的無限長度生成,並對運動與採樣具有廣泛控制能力。
WeChatCV/Stand-In
透過僅訓練 1% 的額外參數,保持高主體一致性的輕量級、即插即用身份保留型影片生成框架。
Lixsp11/sekai-codebase
Sekai 是一個高品質的自我中心(egocentric)影片數據集,包含超過 5,000 小時的已標註第一人稱與無人機視角影片,用於世界探索與生成。
AMAP-ML/DreamX-World
DreamX-World 是一個通用的互動式世界模型,能生成高保真、可控制的模擬環境,讓使用者透過事件提示探索與轉變環境。
zju3dv/street_crafter
StreetCrafter 是一個利用可控制影片擴散模型與 3D 高斯點陣從新軌跡生成逼真影片的框架。
Vchitect/Latte
一種用於高品質影片生成的潛在擴散 Transformer,支援文字到影片與文字到影像任務。
Orkas-AI/Orkas-VideoStudio
一個使 AI 編碼代理能透過可讀的計畫檔案組合、編輯與生成影片的工具包,為自動化影片製作提供決定性流程。
thu-ml/DiT-Extrapolation
一個用於 Diffusion Transformers 的即插即用框架,透過位置嵌入外推法實現更長的影片與更高解析度的圖像生成。
barefootford/buttercut
一個能為 Final Cut Pro、Premiere 和 DaVinci Resolve 等專業軟體生成 XML 剪輯的 AI 影片編輯代理,可自動化完成素材的初始組裝。
alibaba/Tora
Tora 是一種面向軌跡的擴散變換器,可透過文字、視覺與軌跡引導,精確控制物件運動,實現高品質影片生成。
Kevin-thu/StoryMem
StoryMem 是一個使用記憶條件化擴散模型生成長篇、連貫敘事影片的多鏡頭影片生成框架,可保持角色一致性。
wernerturing/multi-delogo
一款用於移除影片中商標與水印的應用程式,具備自動偵測功能,可處理移動的商標。
ossrs/oryx
Oryx 是一個整合 AI 功能(如字幕生成與配音)的全功能開源影片解決方案,用於建構直播串流與 WebRTC 服務。
Agions/splicr
一個基於 Rust 的 AI 影片旁白引擎,使用多代理系統自動化場景分析、腳本撰寫、語音克隆和時間軸對齊,以供 CapCut 匯出。
IgorShadurin/app.yumcut.com
一個開源的 AI 短影片生成器,可自動化生成 TikTok、YouTube Shorts 與 Instagram Reels 所需的腳本、配音、視覺與字幕。
NevermindNilas/TheAnimeScripter
專為動畫設計的AI驅動影片增強工具包,可在單次處理中實現放大、運動插值與修復。
showlab/Kiwi-Edit
Kiwi‑Edit 是一個開源的影片編輯系統,透過自然語言指令(以及可選的參考圖像)來修改整個影片。它將多模態 LLM 編碼器與影片 Diffusion Transformer 融合,提供風格轉移、物件新增/替換/移除以及背景變更功能。該儲存庫提供了完整的訓練腳本(包含使用 Qwen2.5‑VL‑3B + Wan2.2‑TI2V‑5B 的三階段課程學習)、預訓練的 Diffusers 權重,以及在 OpenVE‑Bench 和 RefVIE‑Bench 上的評估流程。
Anil-matcha/Seedance-2-API
ByteDance 的 Seedance AI 影片生成器的 Python 封裝,支援高保真度的文字到影片與影像到影片生成,重點實現真實人類臉部與角色一致性。
simchowitzlabpublic/nano-world-model
基於擴散強制的極簡框架,用於訓練視頻世界模型,適用於未來視頻預測、3D 重建與機器人規劃。
microsoft/LatentSpatialMemory
一個用於視訊世界模型的框架,將 3D 場景內容儲存為潛在表示,透過避免重複的 RGB 渲染來提升生成速度並減少記憶體開銷。
TencentARC/VerseCrafter
VerseCrafter 是一個可控影片世界模型,透過 4D 幾何控制與 GeoAdapter,為真實影片中的相機與多物件運動提供精確且可解釋的控制。
nvidia-cosmos/cosmos-predict1
一套專為未來狀態預測設計的世界基礎模型,能從文字或影片提示生成視覺模擬,以支援 Physical AI 的開發。
Tencent-Hunyuan/HY-WorldPlay
HY-World 1.5 是一個即時互動式世界建模框架,利用串流影片擴散技術,根據使用者輸入生成幾何一致的 3D 環境。
Tencent-Hunyuan/HunyuanVideo-1.5
一個輕量級的 8.3 億參數影片生成模型,能在消費級 GPU 上實現高品質的文字轉影片與圖像轉影片合成。
JingyunLiang/VRT
VRT 是影片修復Transformer(VRT)的PyTorch實作,一種基於Transformer的模型,可處理影片超解析度、去模糊、去雜訊、幀插值與時空超解析度。它採用時間互相關自注意力與平行變形機制,捕捉長程時間依賴性,在九個基準測試中實現最頂尖PSNR提升。倉儲包含預訓練權重、測試腳本、Colab示範以及標準影片資料集的訓練說明。
caiyuanhao1998/Open-OmniVCus
OmniVCus 是一個前饋式主題驅動的影片客製化框架,利用擴散Transformer在深度與遮罩等多模態控制條件下生成特定主題的影片。