NVlabs/LongLive

基于 NVFP4 的并行基础设施,优化长视频生成的训练与蒸馏,实现高吞吐、实时推理。

TheOrcDev/videorc

Videorc 是一个开源、AI 增强的桌面工作室,让创作者能够捕获屏幕/摄像头,向多个平台直播,并自动生成功能字幕、标题、章节和亮点——所有操作均通过单一的场景化界面完成。

WeChatCV/Wan-Alpha

一个视频生成框架,使用可平移的 RGB‑A 分布学习器,实现高质量、透明度(alpha 通道)稳定的视频制作。

AlayaLab/AlayaWorld

一种结合空间与时间记忆的自回归世界模型,支持实时相机控制,实现长时序、可交互、可播放的视频生成。

JayWebtech/autoshorts

一款本地优先的桌面应用,利用 AI 识别长视频或音频中的爆款瞬间,并自动将其裁剪为竖屏短片。

Robbyant/lingbot-video

一个专为具身智能设计的开源 MoE 视频生成模型,旨在为机器人和物理世界理解生成具有物理合理性的视频。

VelornLabs/velorn

一个开源 AI 视频工作站,通过 ComfyUI 和基于 MCP 的智能体自动化,将完整的时序编辑器与 AI 生成工作流相结合。

NVIDIA/flashdreams

一个用于交互式自回归视频与世界模型的高性能推理与服务库,针对机器人与自动驾驶车辆的实时应用进行了优化。

shengshu-ai/minWM

一个全栈开源框架,用于将文本转视频基础模型转化为具备动作条件的实时视频世界模型。

ronak-create/FableCut

一个仅在浏览器中运行的非线性视频编辑器,其时间线是一个 JSON 文件,可通过 MCP、REST 或直接文件写入由人类或 AI 代理实时编辑。零 npm 依赖,可选 ffmpeg 用于快速导出,内置 AI 背景移除功能。

amap-cvlab/ABot-World

ABot-World 是一个实时交互世界模拟器,可在单个桌面 GPU 上实现无限、行动条件化的视频生成。

cclank/lanshu-create-ai-presenter-video

一种通用的AI数字人视频制作工作流程,可将脚本和图像转换为带有字幕和特效的同步演示视频。

Netflix/vmaf

Netflix 开发的获得艾美奖的感知视频质量评估工具,通过融合多种指标客观衡量视频退化。

Anil-matcha/Open-AI-Micro-Drama-Generator

一个代理型AI流水线,通过自动化故事开发、角色设计和视频制作,将简单想法或脚本转化为完整的电影级微戏剧视频。

ModelTC/Minimax-H3-Turbo

一组为 MiniMax-H3 设计的蒸馏 LoRA 检查点,通过 Diffusers 和 ComfyUI 实现快速、少步数的视频和音频生成。

vrgamegirl19/comfyui-vrgamedevgirl

一个包含 AI 视频构建器(用于分镜式制作)、视频增强以及 AI 视频和音乐视频创作用 LoRA 训练的 ComfyUI 自定义节点集合。

Agentchengfeng/chengfeng-videocut-skills

一个 Codex 插件安装入口,为 AI 代理提供通过 chengfeng-videocut 运行时执行视频编辑所需的工具和方法。

Soul-AILab/SoulX-FlashTalk

SoulX-FlashTalk 是一个利用自校正双向蒸馏技术,实现音视频驱动头像连续实时无限流式传输的系统。

RafaelGodoyEbert/ViralCutter

一个开源的本地 AI 工具,可将长 YouTube 视频自动转换为病毒式传播的短视频,支持自动裁剪、动态字幕和人脸追踪。

thu-ml/Causal-Forcing

使用因果 ODE 或因果一致性蒸馏的高质实时交互式视频生成框架,支持高效少步自回归扩散

SamurAIGPT/Seedance-2.5-API

一个用于 ByteDance 的 Seedance 2.5 API 的 Python 包装器,能够生成具有高级角色一致性和多模态引用支持的高保真 AI 视频。

huytranvan2010/AI-auto-generate-video

一个自动化流水线,利用 AI 进行脚本生成和确定性 HTML 到视频的渲染,将越南语文本文章转换为 9:16 的短视频。

shinkuan/Akagi

Akagi 是一个基于 Rust 的桌面助手,用于在线立直麻将(Mahjong Soul、Tenhou 等)。它通过 MITM 代理或 Chromium DevTools 捕获游戏流量,运行内置神经网络机器人(以及可选的云端推理模型)来计算数牌、待牌、和牌概率、对手风险和建议弃牌,并在可拖动的 HUD 中显示。已完成的对局会本地存储,并在历史记录标签页中以段位饼图、PT 趋势线和详细统计数据进行可视化。该应用以单个便携式二进制文件形式提供,支持 Windows、macOS(Apple Silicon)和 Linux,使用 Tauri 2 + React 构建 UI,采用 Apache 2.0 许可证。

Lightricks/ComfyUI-LTXVideo

一套扩展 LTX-2 视频生成模型功能的自定义 ComfyUI 节点和工作流,支持 HDR 转换、多语言配音和生成式上采样。

BrokenSource/DepthFlow

DepthFlow 是一个开源的图像转视频转换器,它利用深度估计和优化的着色器将静态图片转换为 3D 视差动画。

LeonQ8/ComfyUI-ALLinONE-MinimaxH3

一个统一的 ComfyUI 节点,通过将文本到视频、图像到视频以及高级编辑工具整合到单一界面,简化了 MiniMax H3 视频流水线。

WhatDreamsCost/WhatDreamsCost-ComfyUI

WhatDreamsCost‑ComfyUI 是一组自定义 ComfyUI 节点,为 AI 生成媒体工作流添加视频和音频编辑功能(时间线编辑器、加载/裁剪节点、IC-LoRA 支持、音频修复等)。

ItusiAI/Open-Magiviz

一个AI驱动的视频创作平台,可自动化从脚本生成、角色设计、分镜创建到最终视频渲染的全流程。

NO6KIKO/gorest-2d-animation-spritesheet-generator

Gorest 是一个基于 Node 的、可在浏览器中运行的编辑器,可构建 2D 游戏场景,生成或导入精灵图集,附加丰富元数据,并预览动画——支持可选的 Codex 驱动提示。资产本地存储,并包含用于转盘式精灵的伪 3D 旋转功能。

naqashafzal/AI-Content-Studio

一个自动化 AI 视频和播客生成器,可将长篇 YouTube 视频转换为病毒式短视频,并从文本提示生成 AI 驱动的播客。

agan-j/xiaoniu

一款 AI 驱动的视频翻译工具,能够自动进行语音翻译、声音克隆和唇形同步,帮助创作者将短剧和宣传视频本地化,面向全球观众。

google-deepmind/tapnet

Google DeepMind 的 TAP‑Net 仓库为“Tracking Any Point”(任意点追踪)任务提供数据集、预训练模型(TAPIR, BootsTAPIR, TAPNext/Next++)、训练代码以及 Colab/实时演示。该任务是一种精确的点级视频追踪技术,对视觉研究和机器人模仿学习非常有用。

toki-plus/video-mover

一个从文件监控、AI生成字幕到多平台浏览器自动化上传的全自动视频分发流水线。

mira-wm/mira

MIRA 是一个基于 50 亿参数潜在扩散模型的 Rocket League 实时世界模型,可根据玩家操作模拟 2v2 比赛。

rediumvex/ai-video-generator-claude

为 Higgsfield 上的 Seedance 2.0 生成专业、电影级视频提示词的 Claude 提示词工程技能集。

SamurAIGPT/Text-To-Video-AI

一个AI驱动的视频创作工具,可将文本提示转化为包含脚本、旁白、B-roll和同步字幕的完整编辑视频。

cclank/lanshu-awesome-ai-video-kit

一个包含 543 个经过测试的提示词、支持 15 种模型以及官方端点自动化监控的全面性 AI 视频提示词工程工具包。

hzwer/Practical-RIFE

RIFE 和 SAFA 的实用实现,用于视频帧插值和增强,使用户能够提升视频帧率以获得更流畅的运动效果。

aigc-apps/VideoX-Fun

支持 CogVideoX-Fun 和 Wan 2.1 模型的视频生成流水线,适用于文本、图像和视频到视频生成,具备高级结构和相机控制功能。

aqm857886159/Nomi

一个开源、本地优先的桌面工作台,用于 AI 视频制作,允许用户结合多种生成源和本地 ComfyUI,以降低制作成本。

SamurAIGPT/AI-Faceless-Video-Generator

一个自动化流水线,通过结合 GPT 脚本生成、文本转语音和 SadTalker 面部动画,从主题生成口播视频。

showlab/Code2Video

一种基于代理的框架,通过合成可执行的 Manim 代码而非像素来生成高质量教育视频,确保数学精确性与连贯性。

james-see/ltx-video-mac

一款用于在 Apple Silicon 上进行本地 AI 视频生成的原生 SwiftUI macOS 应用,支持 LTX 和 MiniMax H3 模型,并集成音频和配音工具。

NVlabs/rcm

一种用于蒸馏大型视频扩散模型的得分正则化连续时间一致性模型,可在 2–4 步内实现高质量、多样化的视频生成。

bytedance/Bernini

Bernini 是一个统一的视频生成与编辑框架,结合了基于 MLLM 的语义规划器与基于 DiT 的渲染器,以提升指令遵循能力与复杂视频编辑效果。

nv-tlabs/omni-dreams

通过文本、高清地图和轨迹位姿,为自动驾驶仿真实时生成逼真多摄像头视频的世界模型。

Correr-Zhou/OmniShow

OmniShow 是一个统一文本、参考图像、音频和姿态条件的多模态视频生成模型,可生成人类与物体交互的高保真视频。

EvoLinkAI/GPT-Image-2-Seedance-2.5-Workflow

一套精选的工作流程和提示模板,用于结合 GPT Image 2 和 Seedance,从故事板生成高质量 AI 视频。