a312863063/Video-Auto-Wipe
一種自動檢測並擦除影片中字幕與圖示等固定模式內容的影片修復工具。
qingmeng1/bilijump-ai
一個 Chrome/Firefox 擴充功能,使用基於 LLM 的字幕或音訊分析來自動偵測並跳過 Bilibili 影片中的廣告片段,並提供可選的手動跳過、使用者可編輯的廣告時間戳,以及支援自訂 AI 端點。
tomateo1reg/sora2-watermark-remover-web-gui
一個基於 Flask 的 Web 應用程式,允許您上傳影片,在 GPU 上執行深度學習浮水印移除模型,並透過現代瀏覽器 UI 或小型 REST API 返回清理後的影片。
okineadev/vitepress-plugin-llms
一個 VitePress 插件,可在建置時自動產生 LLM 友好的 Markdown 檔案(`llms.txt` 和 `llms‑full.txt`),並提供可選的複製/下載頁面為 Markdown 的 UI 按鈕,支援自訂標籤、多語言設定以及特殊 `<llm-only>` / `<llm-exclude>` 標籤。
joeseesun/qiaomu-cut-skill
一個將文字提示轉化為可重現影片專案的代理原生影片導演,透過自動化資產取得、鏡頭規劃與 ffmpeg 渲染實現全流程自動化。
princepainter/ComfyUI-PainterI2V
一個 Wan2.2 用的 ComfyUI 節點,透過增加運動幅度並提升相機運動回應性,解決圖像轉動畫生成中的慢動作問題。
bytedance/vidi
用於影片理解與創作的大規模多模態模型 (LMM) 系列,能夠實現時間檢索、時空定位與自動影片編輯等任務。
OpenGVLab/VideoChat-Flash
VideoChat-Flash 是一種用於高效處理長達三小時的長上下文影片的多模態大語言模型,採用分層壓縮技術。
daydreamlive/scope
一個使用自回歸擴散模型與可組合架構,用於執行與自訂即時、互動式生成式 AI 影片流程的工具。
amanchadha/iSeeBetter
一個時空視頻超解析度專案,使用循環生成式後向投影網路與 GAN,在保持時間一致性與細緻細節的同時,對低解析度視頻進行上採樣。
EternalEvan/Astra
Astra 是一個互動式世界模型,它使用自回歸擴散 Transformer 來生成逼真的、以動作為條件的長期影片預測。
vargHQ/sdk
一個開源的 TypeScript SDK,讓開發者與 AI 代理能使用宣告式 JSX 語法以及統一的 API,為多家 AI 供應商建立 AI 生成影片。
jdh-algo/JoyVASA
JoyVASA 是一個基於 diffusion 的框架,利用音訊為人類與動物肖像製作動畫,將臉部身份與動作解耦,以實現高品質、長時段的影片生成。
gudaochangsheng/RefAlign
一種用於參考影片生成的訓練時對齊框架,可在不增加推論開銷的情況下提升身份一致性和參考保真度。
EzioBy/Ditto
Ditto 是一個用於產生高品質合成影片編輯資料的框架,供訓練 Editto——最先進的指令式影片編輯模型使用。
PKU-YuanGroup/ConsisID
ConsisID 是一個無需調校、基於 DiT 的文字轉影片生成模型,使用頻率分解在生成的影片幀中保持一致的人類身份。
PKU-YuanGroup/MagicTime
MagicTime 是一個變形影片生成管線,旨在根據文字提示創建真實的時序縮時影片,呈現顯著的物理變化。
Tencent-Hunyuan/HunyuanVideo-I2V
一個將靜態圖像轉換為高品質影片的影像到影片生成框架,使用多模態大型語言模型(LLM)確保語意一致性。
finnvoor/fx-upscale
一款基於 Metal 的命令列工具,可在 macOS 上將影片檔案放大至更高解析度。
Thmen/EGVSR
一種使用子像素卷積加速高品質視訊放大推論的高效視訊超解析度框架 EGVSR 的 PyTorch 實作。
apiframe-ai/seedance-2.0-api
字節跳動 Seedance 2.0 的 API 實作與範例集,支援文字、影像與多模態參考轉影片生成,並實現同步音訊。
krusemediallc/arcads-claude-code
一個具體的 Claude Code 技能包,用於透過 Arcads API 生成並發布 AI 驅動的廣告素材(影片、圖片、縮圖),包含現成的提示詞、多步驟流程(Pixar 風格、黏土動畫、UGC 等)、成本追蹤以及 Meta 廣告發布助手。
huggingface/llm.nvim
llm.nvim 是一個 Neovim 外掛,透過 llm-ls 語言伺服器呼叫大型語言模型,提供 AI 驅動的程式碼補全(幽靈文字)功能。它支援多種後端(Hugging Face Inference API、Ollama、相容 OpenAI 的伺服器以及 Hugging Face TGI),能自動裁減提示詞以符合模型的上下文視窗,並提供可自訂的檔案啟用設定、Fill-in-the-middle 支援以及自訂請求參數。
DeepMyst/Mysti
Mysti 是一款 VS Code 擴充功能,整合了 12 種程式碼生成 AI 提供者(包括 Claude、Codex、Gemini、Copilot、Ollama、LocalAI 等),並增加了多代理腦力激盪、開發者角色、具備安全控制的自主執行、@提及路由以及自動上下文壓縮等協作功能。安裝擴充功能,新增至少一個提供者 CLI(安裝第二個即可進行腦力激盪),透過 JSON 設定進行配置,即可直接在編輯器中開始 AI 輔助編碼。
Songssx/ComfyUI-MiniMaxH3-TimelineDirector
一個為 ComfyUI 添加時間軸式 UI 和一組節點的插件,用於使用 MiniMax H3 生成任意長度的影片。它將目標時長拆分為潛在延續段,應用漂移控制遮罩,支援鎖定音訊唇形同步,並內建兩階段 SelfLift 採樣以實現快速低解析度 + 高解析度生成。透過克隆至 `ComfyUI/custom_nodes` 安裝,再使用材料規劃器安排媒體、設定生成窗口,並執行有限段採樣節點以產生無縫 MP4。
vita-epfl/Stable-Video-Infinity
一個基於基礎影片模型上的 LoRA 適配器,用於生成具有高時間一致性和可控故事情節的無限長度影片的框架。
0xsline/StoryGen-Atelier
一個利用 Gemini 和 Vertex AI Veo 生成分鏡腳本並將其串接成連貫影片的 AI 輔助工具。
sb2702/free-ai-video-upscaler
一款免費、基於瀏覽器的 AI 影片放大工具,讓使用者無需註冊或下載軟體即可提升影片解析度。
google-deepmind/videoprism
VideoPrism 是 Google‑DeepMind 開源的視頻基礎模型(JAX/Flax),提供預訓練的純視頻與視頻-文字編碼器。該模型在數十億圖像-文字與視頻-文字對上訓練,凍結的主幹網絡在多數視頻理解基準上達成最優水平。專案提供簡易安裝、檢查點載入工具,以及三個 Colab 示範(視頻編碼、跨模態檢索、分類微調)。四種模型尺寸(基礎/大型,僅編碼器或編碼器+文字)已託管於 Hugging Face,採用 Apache 2.0/CC‑BY 授權。