EvoLinkAI/GPT-Image-2-Seedance-2.5-Workflow

一套精选的工作流程和提示模板,用于结合 GPT Image 2 和 Seedance,从故事板生成高质量 AI 视频。

zhouwei713/seedance-prompt

一种用于AI视频生成的提示框架与技能,通过用真实拍摄设备和人为不完美细节替代通用描述,消除“AI感”。

geekjourneyx/hyperframes-motion-director

一种将文本内容转换为结构化动态视频制作物的 Agent Skill,具有用于规划和资产生成的专业两阶段工作流。

nvidia-cosmos/cosmos-predict2.5

NVIDIA Cosmos‑Predict 2.5 是一个开源扩散模型,可将文本、图像或视频转换为未来状态的视频预测。支持 2 B/14 B 检查点,具备机器人和自动驾驶车辆专用变体、LoRA 微调、蒸馏功能,并与 Hugging Face Diffusers 集成。专为物理 AI(机器人、AV 模拟、视频分析)设计,提供详细文档、后训练配方菜谱,代码采用 Apache 2.0 许可,权重采用 NVIDIA Open Model License。

madebyollin/taehv

TAEHV 是一个极小的自动编码器,可加速并优化多种扩散模型(Hunyuan、MiniMax-H3、Wan-Video、CogVideoX、Open-Sora、LTX-2 等)的视频 VAE 解码。它将 61 帧 512×320 视频片段的解码时间从约 2–3 秒 / 6–9 GB 降至约 0.5 秒 / <0.5 GB,仅带来轻微画质损失。仓库包含模型检查点、Python API(`TAEHV`、`StreamingTAEHV`)、示例笔记本,以及 ComfyUI、stable-diffusion.cpp、SDNext 和 Diffusers 的集成说明。

PKU-YuanGroup/Helios

Helios 是一个拥有 14B 参数的实时长视频生成模型,在单块 H100 GPU 上即可生成分钟级、高画质的视频,帧率高达 19.5 FPS。

microsoft/DCVC

一种超快速的神经视频编解码器,采用基于分块的编码框架,实现高压缩效率和极快的编解码速度。

wuwukaka/ComfyUI-WanAnimatePlus

ComfyUI WanVideo 工作流的扩展插件,可实现无缝视频连接与多重参考图注入,以提升 AI 视频生成的连贯性。

google-deepmind/physics-IQ-benchmark

一个高质量的基准测试数据集和工作流程,用于使用真实世界镜头评估生成式视频模型的物理理解能力和真实感。

EvoLinkAI/awesome-seedance-2.5-guide

Seedance 2.5 的官方指南与展示,提供高端 AI 视频生成的详细提示和 API 示例。

NVlabs/AnyFlow

AnyFlow 是一个任意步数视频扩散框架,可让单个模型适应任意推理预算以实现高质量视频生成。

facebookresearch/mae_st

一种用于时空学习的 PyTorch 实现的掩码自编码器,使模型能够通过重建被掩码的视频帧来学习视频表示。

MCG-NJU/VideoChat3

VideoChat3 是一个 4B 参数的通用视频 MLLM,专为高效视频理解而设计,涵盖从细微运动到长视频推理,再到直播流主动响应的全部能力。

Eyeline-Labs/Vista4D

Vista4D 是一个视频重拍框架,使用 4D 点云从源视频中通过新相机轨迹和视角合成动态场景。

microsoft/World-R1

World-R1 是一个强化学习框架,通过在不改变基础模型架构的前提下,将生成的视频与 3D 约束对齐,提升文本生成视频的 3D 几何一致性。

SandAI-org/MAGI-1

MAGI-1 是一种自回归视频生成模型,通过逐块生成高保真视频,以确保时间一致性和物理精确性。

linzzzzzz/openclip

一个自动化的 AI 流水线,能从长视频和直播中提取吸引人的精彩片段,并提供转录、AI 分析以及带有字幕和封面的自动剪辑生成功能。

marcelo-earth/generative-manim

Generative Manim 是一个开源工具,使用 LLM(GPT‑4o、Claude、Gemini 等)将自然语言提示转换为可运行的 Manim 动画代码和渲染视频。它提供 Web 演示、REST API 和本地渲染的桌面应用(Animo),还包含用于微调开源权重模型以生成 Manim 代码的训练流水线和基准测试套件。

chenfengxu714/StreamDiffusionV2

一种用于实时流媒体视频生成的交互式扩散管道,可在单GPU和多GPU设置中优化吞吐量和延迟。

louisedesadeleer/clipify

一个 Claude Code 技能,能自动将长篇说话人视频转换为简短且适合社交媒体的短视频,并具备自动重新构图与字幕功能。

yaoyao-jpg/PhiZero

PhiZero 是一款世界模型,通过在渲染结果为视频之前,先在离散的 Physical Language 中进行推理,来预测未来的物理动力学。

Kosinkadink/ComfyUI-AnimateDiff-Evolved

一个为 ComfyUI 提供的高级 AnimateDiff 集成,可实现高质量 AI 动画的无限长度生成,并对运动和采样具有广泛控制能力。

WeChatCV/Stand-In

通过仅训练 1% 的额外参数,保持高主体一致性的轻量级、即插即用身份保留型视频生成框架。

Lixsp11/sekai-codebase

Sekai 是一个高质量的自我中心(egocentric)视频数据集,包含超过 5,000 小时的已标注第一人称和无人机视角视频,用于世界探索与生成。

AMAP-ML/DreamX-World

DreamX-World 是一个通用的交互式世界模型,能够生成高保真、可控制的模拟环境,使用户通过事件提示探索和改造环境。

zju3dv/street_crafter

StreetCrafter 是一个利用可控视频扩散模型和 3D 高斯点阵从新轨迹生成逼真视频的框架。

Vchitect/Latte

一种用于高质量视频生成的潜在扩散 Transformer,支持文本到视频和文本到图像任务。

Orkas-AI/Orkas-VideoStudio

一个使 AI 编码代理能够通过可读的计划文件组合、编辑和生成视频的工具包,为自动化视频制作提供确定性流程。

thu-ml/DiT-Extrapolation

一个用于 Diffusion Transformers 的即插即用框架,通过位置嵌入外推法实现更长的视频和更高分辨率的图像生成。

barefootford/buttercut

一个能为 Final Cut Pro、Premiere 和 DaVinci Resolve 等专业软件生成 XML 剪辑的 AI 视频编辑代理,可自动化完成素材的初始组装。

alibaba/Tora

Tora 是一种面向轨迹的扩散变换器,可通过文本、视觉和轨迹引导,精确控制物体运动,实现高质量视频生成。

Kevin-thu/StoryMem

StoryMem 是一个使用记忆条件化扩散模型生成长篇、连贯叙事视频的多镜头视频生成框架,可保持角色一致性。

wernerturing/multi-delogo

一款用于移除视频中logo和水印的应用程序,具备自动检测功能,可处理移动的logo。

ossrs/oryx

Oryx 是一个集成了 AI 能力(如字幕生成和配音)的全栈开源视频解决方案,用于构建直播流媒体和 WebRTC 服务。

Agions/splicr

一个基于 Rust 的 AI 视频旁白引擎,使用多智能体系统自动化场景分析、脚本编写、语音克隆和时间轴对齐,以供 CapCut 导出。

IgorShadurin/app.yumcut.com

一个开源的 AI 短视频生成器,可自动化生成 TikTok、YouTube Shorts 和 Instagram Reels 所需的脚本、配音、视觉和字幕。

NevermindNilas/TheAnimeScripter

专为动画设计的AI驱动视频增强工具包,可在单次处理中实现放大、运动插值和修复。

showlab/Kiwi-Edit

Kiwi‑Edit 是一个开源视频编辑系统,通过自然语言指令(以及可选的参考图像)来修改整个视频。它将多模态 LLM 编码器与视频 Diffusion Transformer 融合,提供风格转移、对象新增/替换/删除以及背景变更功能。该仓库提供了完整的训练脚本(包含使用 Qwen2.5‑VL‑3B + Wan2.2‑TI2V‑5B 的三阶段课程学习)、预训练的 Diffusers checkpoints,以及在 OpenVE‑Bench 和 RefVIE‑Bench 上的评估流程。

Anil-matcha/Seedance-2-API

ByteDance 的 Seedance AI 视频生成器的 Python 封装,支持高保真度的文本到视频和图像到视频生成,重点实现真实人类面部与角色一致性。

simchowitzlabpublic/nano-world-model

基于扩散强制的极简框架,用于训练视频世界模型,适用于未来视频预测、3D 重建和机器人规划。

microsoft/LatentSpatialMemory

一个用于视频世界模型的框架,将 3D 场景内容存储为潜在表示,通过避免重复的 RGB 渲染来提高生成速度并减少内存开销。

TencentARC/VerseCrafter

VerseCrafter 是一个可控视频世界模型,通过 4D 几何控制和 GeoAdapter,为真实视频中的相机和多对象运动提供精确且可解释的控制。

nvidia-cosmos/cosmos-predict1

一套面向未来状态预测的世界基础模型,能够从文本或视频提示生成视觉模拟,以支持 Physical AI 的开发。

Tencent-Hunyuan/HY-WorldPlay

HY-World 1.5 是一个实时交互式世界建模框架,利用流式视频扩散技术,根据用户输入生成几何一致的3D环境。

Tencent-Hunyuan/HunyuanVideo-1.5

一个轻量级的 8.3 亿参数视频生成模型,能够在消费级 GPU 上实现高质量的文本到视频和图像到视频合成。

JingyunLiang/VRT

VRT 是视频修复Transformer(VRT)的PyTorch实现,一种基于Transformer的模型,可处理视频超分辨率、去模糊、去噪、帧插值和时空超分辨率。它采用时间互相关自注意力和并行变形机制,捕捉长程时间依赖性,在九个基准测试中实现最先进PSNR提升。仓库包含预训练权重、测试脚本、Colab演示以及标准视频数据集的训练说明。

caiyuanhao1998/Open-OmniVCus

OmniVCus 是一个前馈式主题驱动的视频定制框架,利用扩散Transformer在深度和掩码等多模态控制条件下生成特定主题的视频。

a312863063/Video-Auto-Wipe

一种自动检测并擦除视频中字幕和logo等固定模式内容的视频修复工具。