a312863063/Video-Auto-Wipe

字幕やロゴなどの固定パターンのコンテンツを自動検出し、動画から削除するツール。

qingmeng1/bilijump-ai

LLMベースの字幕または音声分析を使用してBilibili動画の広告セグメントを自動的に検出してスキップするChrome/Firefox拡張機能。オプションの手動スキップ、ユーザーが編集可能な広告タイムスタンプ、カスタムAIエンドポイントのサポートも備えています。

tomateo1reg/sora2-watermark-remover-web-gui

動画のアップロード、GPU上で深層学習ウォーターマーク除去モデルの実行、そしてモダンなブラウザUIまたは小さなREST APIを通じてクリーンアップされた動画の返却を可能にするFlaskベースのWebアプリ。

okineadev/vitepress-plugin-llms

VitePress プラグインで、ビルド時に LLM 向けの Markdown ファイル(`llms.txt` と `llms‑full.txt`)を自動生成し、オプションのコピー/ダウンロード用 UI ボタンを提供。カスタムラベル、多言語設定、および特殊な `<llm-only>` / `<llm-exclude>` タグをサポート。

joeseesun/qiaomu-cut-skill

テキストプロンプトを再現可能な動画プロジェクトに変換するエージェントネイティブな動画ディレクターで、アセット調達、ショット計画、ffmpegレンダリングを自動化します。

princepainter/ComfyUI-PainterI2V

Wan2.2 用の ComfyUI ノードで、画像から動画生成時の遅い動きを改善し、動きの振幅を増加させ、カメラの動きの応答性を高めます。

bytedance/vidi

ビデオの理解と生成のための大規模マルチモーダルモデル(LMM)ファミリーであり、時間的検索、時空間グラウンディング、自動ビデオ編集などのタスクを可能にします。

OpenGVLab/VideoChat-Flash

VideoChat-Flashは、階層的圧縮を用いて3時間に及ぶ超長動画を効率的に理解できるマルチモーダル大規模言語モデルです。

daydreamlive/scope

自己回帰型拡散モデルとコンポーザブルアーキテクチャを用いた、リアルタイムでインタラクティブな生成AIビデオパイプラインを実行・カスタマイズするためのツール。

amanchadha/iSeeBetter

空間時間的動画スーパーレゾリューションプロジェクト。再帰的生成的バックプロジェクションネットワークとGANを用いて、時間的一貫性と細かいディテールを維持しながら低解像度動画を拡大する。

EternalEvan/Astra

Astraは、自己回帰的な拡散トランスフォーマーを使用して、現実的なアクション条件付きの長期間ビデオ予測を生成するインタラクティブな世界モデルです。

vargHQ/sdk

オープンソースの TypeScript SDK で、開発者や AI エージェントが宣言的 JSX 構文と統一 API を使って複数の AI プロバイダー向けに AI 生成動画を作成できます。

jdh-algo/JoyVASA

JoyVASA は diffusion ベースのフレームワークで、音声を用いて人間や動物のポートレートをアニメーション化し、顔のアイデンティティと動きを分離して高品質かつ長尺の動画生成を可能にします。

gudaochangsheng/RefAlign

推論時にオーバーヘッドを追加せずに、アイデンティティの一貫性と参照の忠実度を向上させる、参照から動画生成のためのトレーニング時アライメントフレームワーク。

EzioBy/Ditto

Ditto is a framework for generating high-quality synthetic video editing data to train Editto, a state-of-the-art instruction-based video editing model.

PKU-YuanGroup/ConsisID

ConsisID は、チューニング不要で DiT ベースのテキストから動画への生成モデルで、周波数分解を用いて生成された動画フレーム間で一貫した人物のアイデンティティを保ちます。

PKU-YuanGroup/MagicTime

MagicTime は、テキストプロンプトに基づいて現実的なタイムラプス動画を生成し、顕著な物理的変化を描写するメタモルフィック動画生成パイプラインです。

Tencent-Hunyuan/HunyuanVideo-I2V

静止画像を高品質な動画に変換する画像から動画への生成フレームワークで、マルチモーダルLLMを用いて意味的一貫性を保ちます。

finnvoor/fx-upscale

macOS上で、Metalを活用したコマンドラインツールによる動画ファイルの高解像度化。

Thmen/EGVSR

サブピクセル畳み込みを用いて高品質な動画拡大の推論速度を高速化する、効率的な動画スーパーレゾリューションフレームワークであるEGVSRのPyTorch実装。

apiframe-ai/seedance-2.0-api

ByteDanceのSeedance 2.0用のAPI実装と例セット。テキスト、画像、マルチモーダル参照による動画生成と同期オーディオを可能にします。

krusemediallc/arcads-claude-code

Arcads API を介して AI 主導の広告クリエイティブ(動画、画像、サムネイル)を生成・公開するための具体的な Claude Code スキルパック。すぐに使えるプロンプト、マルチステップパイプライン(Pixar 風、クレイアニメ、UGC など)、コスト追跡、Meta 広告公開ヘルパーが含まれています。

huggingface/llm.nvim

llm.nvimは、llm-ls言語サーバーを介して大規模言語モデルを呼び出し、AI駆動のコード補完(ゴーストテキスト)を追加するNeovimプラグインです。複数のバックエンド(Hugging Face Inference API、Ollama、OpenAI互換サーバー、Hugging Face TGI)をサポートし、モデルのコンテキストウィンドウに合わせてプロンプトを自動的にトリミングします。また、ファイルごとの有効化設定、Fill-in-the-middleサポート、カスタムリクエストパラメータも提供します。

DeepMyst/Mysti

Mystiは、12種類のコード生成AIプロバイダー(Claude、Codex、Gemini、Copilot、Ollama、LocalAIなど)を統合したVS Code拡張機能です。マルチエージェントによるブレインストーミング、開発者ペルソナ、安全制御付きの自律実行、@メンションによるルーティング、自動コンテキスト圧縮などのコラボレーション機能を提供します。拡張機能をインストールし、少なくとも1つのプロバイダーCLIを追加(ブレインストーミングには2つ必要)してJSON設定で構成すれば、エディタ内で直接AIコーディングを開始できます。

Songssx/ComfyUI-MiniMaxH3-TimelineDirector

MiniMax H3で任意の長さの動画を生成できるComfyUIプラグイン。ターゲットの再生時間を潜在継続セグメントに分割し、ドリフト制御マスクを適用、ロックされたオーディオリップシンクをサポート。内蔵の2段階SelfLiftサンプリングにより、高速な低解像度+高解像度生成が可能。`ComfyUI/custom_nodes`にクローンしてインストールし、マテリアルプランナーでメディアを配置、生成ウィンドウを設定、Finite Segment Samplingノードを実行してシームレスなMP4を生成。

vita-epfl/Stable-Video-Infinity

ベースビデオモデル上の LoRA アダプターを使用して、高い時間的一貫性と制御可能なストーリーラインを持つ無限長のビデオを生成するためのフレームワーク。

0xsline/StoryGen-Atelier

GeminiとVertex AI Veoを使用して絵コンテを生成し、それらを一貫性のある動画に繋ぎ合わせるAI支援ツール。

sb2702/free-ai-video-upscaler

サインアップやソフトウェアのダウンロード不要で、動画の解像度を向上させることができる、ブラウザベースの無料AI動画アップスケーラーです。

google-deepmind/videoprism

VideoPrismは、Google‑DeepMindがオープンソースで公開したビデオ基礎モデル(JAX/Flax)であり、事前学習済みのビデオ専用およびビデオ・テキストエンコーダーを提供します。数十億の画像・テキストおよびビデオ・テキストペアで学習されたフリーズされたバックボーンは、ほとんどのビデオ理解ベンチマークで最先端の結果を達成します。リポジトリにはインストールが簡単で、チェックポイントの読み込みユーティリティ、および3つのColabデモ(ビデオエンコーディング、クロスモーダル検索、分類ファインチューニング)が用意されています。4種類のモデルサイズ(ベース/ラージ、エンコーダー専用またはエンコーダー+テキスト)がHugging Faceにホストされており、Apache 2.0/CC‑BYライセンスで提供されています。