qingmeng1/bilijump-ai
一个 Chrome/Firefox 扩展程序,使用基于 LLM 的字幕或音频分析来自动检测并跳过 Bilibili 视频中的广告片段,并提供可选的手动跳过、用户可编辑的广告时间戳,以及支持自定义 AI 端点。
tomateo1reg/sora2-watermark-remover-web-gui
一个基于 Flask 的 Web 应用,允许您上传视频,在 GPU 上运行深度学习水印去除模型,并通过现代浏览器 UI 或小型 REST API 返回清理后的视频。
okineadev/vitepress-plugin-llms
一个 VitePress 插件,可在构建时自动生成 LLM 友好的 Markdown 文件(`llms.txt` 和 `llms‑full.txt`),并提供可选的复制/下载页面为 Markdown 的 UI 按钮,支持自定义标签、多语言配置以及特殊 `<llm-only>` / `<llm-exclude>` 标签。
joeseesun/qiaomu-cut-skill
一个将文本提示转化为可复现视频项目的代理原生视频导演,通过自动化资产获取、镜头规划和 ffmpeg 渲染实现全流程自动化。
princepainter/ComfyUI-PainterI2V
一个 Wan2.2 用的 ComfyUI 节点,通过增加运动幅度并提升相机运动响应性,解决图像到视频生成中的慢动作问题。
bytedance/vidi
用于视频理解和创作的大规模多模态模型 (LMM) 系列,能够实现时间检索、时空定位和自动视频编辑等任务。
OpenGVLab/VideoChat-Flash
VideoChat-Flash 是一种用于高效处理长达三小时的长上下文视频的多模态大语言模型,采用分层压缩技术。
daydreamlive/scope
一个使用自回归扩散模型和可组合架构,用于运行和自定义实时、交互式生成式 AI 视频流水线的工具。
amanchadha/iSeeBetter
一个时空视频超分辨率项目,使用循环生成式后向投影网络和 GAN,在保持时间一致性和精细细节的同时,对低分辨率视频进行上采样。
EternalEvan/Astra
Astra 是一个交互式世界模型,它使用自回归扩散 Transformer 来生成逼真的、以动作为条件的长期视频预测。
vargHQ/sdk
一个开源的 TypeScript SDK,允许开发者和 AI 代理使用声明式 JSX 语法以及统一的 API,为多家 AI 提供商创建 AI 生成视频。
jdh-algo/JoyVASA
JoyVASA 是一个基于 diffusion 的框架,利用音频为人类和动物肖像制作动画,将面部身份与动作解耦,以实现高质量、长时段的视频生成。
gudaochangsheng/RefAlign
一种用于参考图转视频生成的训练阶段对齐框架,旨在提高身份一致性和参考忠实度,且不会增加推理阶段的开销。
EzioBy/Ditto
Ditto 是一个用于生成高质量合成视频编辑数据的框架,用于训练 Editto——最先进的指令式视频编辑模型。
PKU-YuanGroup/ConsisID
ConsisID 是一个无需调优、基于 DiT 的文本生成视频模型,使用频率分解在生成的视频帧中保持一致的人类身份。
PKU-YuanGroup/MagicTime
MagicTime 是一个变形视频生成管线,旨在根据文本提示创建真实的时序延时视频,展示显著的物理转变。
Tencent-Hunyuan/HunyuanVideo-I2V
一个将静态图像转换为高质量视频的图像到视频生成框架,使用多模态大型语言模型(LLM)确保语义一致性。
finnvoor/fx-upscale
一款基于 Metal 的命令行工具,可在 macOS 上将视频文件放大至更高分辨率。
Thmen/EGVSR
一种使用子像素卷积加速高质量视频放大推理的高效视频超分辨率框架 EGVSR 的 PyTorch 实现。
apiframe-ai/seedance-2.0-api
字节跳动 Seedance 2.0 的 API 实现与示例集,支持文本、图像和多模态参考到视频的生成,并实现同步音频。
krusemediallc/arcads-claude-code
一个具体的 Claude Code 技能包,用于通过 Arcads API 生成并发布 AI 驱动的广告素材(视频、图片、缩略图),包含现成的提示词、多步骤流程(Pixar 风格、黏土动画、UGC 等)、成本追踪以及 Meta 广告发布助手。
huggingface/llm.nvim
llm.nvim 是一个 Neovim 插件,通过 llm-ls 语言服务器调用大型语言模型,提供 AI 驱动的代码补全(幽灵文字)功能。它支持多种后端(Hugging Face Inference API、Ollama、兼容 OpenAI 的服务器以及 Hugging Face TGI),能自动裁剪提示词以符合模型的上下文窗口,并提供可配置的按文件启用设置、Fill-in-the-middle 支持以及自定义请求参数。
DeepMyst/Mysti
Mysti 是一款 VS Code 扩展,集成了 12 种代码生成 AI 提供商(包括 Claude、Codex、Gemini、Copilot、Ollama、LocalAI 等),并增加了多代理头脑风暴、开发者角色、具备安全控制的自主执行、@提及路由以及自动上下文压缩等协作功能。安装扩展,添加至少一个提供商 CLI(安装第二个即可进行头脑风暴),通过 JSON 设置进行配置,即可直接在编辑器中开始 AI 辅助编码。
Songssx/ComfyUI-MiniMaxH3-TimelineDirector
一个为 ComfyUI 添加基于时间线的 UI 和一组节点的插件,用于使用 MiniMax H3 生成任意长度的视频。它将目标时长拆分为潜在延续段,应用漂移控制掩码,支持锁定音频唇形同步,并内置两阶段 SelfLift 采样以实现快速低分辨率 + 高分辨率生成。通过克隆到 `ComfyUI/custom_nodes` 安装,然后使用材料规划器安排媒体、设置生成窗口,并运行有限段采样节点以生成无缝 MP4。
vita-epfl/Stable-Video-Infinity
一个基于基础视频模型上的 LoRA 适配器,用于生成具有高时间一致性和可控故事情节的无限长度视频的框架。
0xsline/StoryGen-Atelier
一个利用 Gemini 和 Vertex AI Veo 生成分镜脚本并将其串接成连贯视频的 AI 辅助工具。
sb2702/free-ai-video-upscaler
一款免费、基于浏览器的 AI 视频放大工具,让用户无需注册或下载软件即可提升视频分辨率。
google-deepmind/videoprism
VideoPrism 是 Google‑DeepMind 开源的视频基础模型(JAX/Flax),提供预训练的纯视频和视频-文本编码器。该模型在数十亿图像-文本和视频-文本对上训练,冻结的骨干网络在大多数视频理解基准上达到最先进水平。该项目提供简易安装、检查点加载工具,以及三个 Colab 演示(视频编码、跨模态检索、分类微调)。四个模型尺寸(基础/大型,仅编码器或编码器+文本)已托管于 Hugging Face,采用 Apache 2.0/CC‑BY 许可。