Correr-Zhou/OmniShow
OmniShowは、テキスト、参照画像、音声、ポーズの条件を統合して、人間が物体と相互作用する高精細な動画を生成するマルチモーダル動画生成モデルです。
EvoLinkAI/GPT-Image-2-Seedance-2.5-Workflow
GPT Image 2 と Seedance を組み合わせて、ストーリーボードから高品質な AI 動画を生成するための、厳選されたワークフローとプロンプトテンプレートのコレクション。
zhouwei713/seedance-prompt
AI動画生成用のプロンプトフレームワークとスキル。一般的な記述を、現実の撮影機器や人間の不完全さを詳細にシミュレートするものに置き換えることで、「AI風」を排除します。
geekjourneyx/hyperframes-motion-director
テキストコンテンツを構造化されたモーションビデオ制作物へと変換するAgent Skill。プランニングとアセット生成のためのプロフェッショナルな2フェーズのワークフローを備えています。
nvidia-cosmos/cosmos-predict2.5
NVIDIA Cosmos‑Predict 2.5 は、テキスト、画像、または動画を未来状態の動画予測に変換するオープンソースの拡散モデルです。2 B/14 B チェックポイント、ロボットおよび自動運転車向けの特化バージョン、LoRA微調整、蒸留、Hugging Face Diffusers との統合をサポート。物理AI(ロボット工学、AVシミュレーション、動画分析)向けに設計されており、詳細なドキュメント、事後学習レシピブック、Apache 2.0(コード)および NVIDIA Open Model License(重み)のライセンスで提供されます。
madebyollin/taehv
TAEHV は、Hunyuan、MiniMax-H3、Wan-Video、CogVideoX、Open-Sora、LTX-2 など、多数の拡散モデル向けの小さな自動符号化器です。動画 VAE のデコードを高速化・メモリ最適化します。61フレームの 512×320 クリップのデコード時間を約 2〜3 秒 / 6〜9 GB から約 0.5 秒 / <0.5 GB に削減し、わずかな品質の低下を伴います。リポジトリにはモデルのチェックポイント、Python API(`TAEHV`、`StreamingTAEHV`)、例のノートブック、ComfyUI、stable-diffusion.cpp、SDNext、Diffusers への統合ノートが含まれます。
PKU-YuanGroup/Helios
Heliosは、単一のH100 GPUで最大19.5 FPSの分単位の高品質な動画生成が可能な、14Bパラメータのリアルタイム長時間動画生成モデルです。
microsoft/DCVC
チャンクベースの符号化フレームワークを使用して、高い圧縮効率と高速なエンコード/デコード速度を実現する超高速ニューラルビデオコーデック。
wuwukaka/ComfyUI-WanAnimatePlus
ComfyUIのWanVideoパイプラインにおける拡張機能で、シームレスな動画への接続とマルチリファレンス画像の注入により、AI動画生成の整合性を向上させます。
google-deepmind/physics-IQ-benchmark
実世界の映像を使用して、生成動画モデルの物理的理解と現実性を評価するための高品質なベンチマークデータセットとワークフロー。
EvoLinkAI/awesome-seedance-2.5-guide
Seedance 2.5の公式ガイドおよびショーケース。ハイエンドAI動画生成のための詳細なプロンプトとAPI例を提供。
NVlabs/AnyFlow
AnyFlowは、高品質な動画生成に任意の推論予算を適用できる、任意ステップの動画拡散フレームワークです。
facebookresearch/mae_st
時空間学習向けのマスク付き自己符号化器(MAE)のPyTorch実装。動画フレームのマスク部分を再構成することで、動画表現を学習可能。
MCG-NJU/VideoChat3
VideoChat3は、微細な動きや長時間の推論、ライブストリームの能動的応答までをカバーする、4Bパラメータの汎用動画MLLMで、効率的な動画理解を実現します。
Eyeline-Labs/Vista4D
Vista4Dは、4Dポイントクラウドを使用して、ソース動画から新しいカメラ軌道と視点で動的シーンを合成する動画リショットフレームワークです。
microsoft/World-R1
World-R1 は、ベースモデルのアーキテクチャを変更せずに生成された動画を 3D 制約と整合させることで、テキストから動画への生成における 3D 幾何学的一貫性を向上させる強化学習フレームワークです。
SandAI-org/MAGI-1
MAGI-1 は自己回帰型ビデオ生成モデルで、時間的一貫性と物理的正確性を確保するために、チャンク単位で高忠実度ビデオを生成します。
linzzzzzz/openclip
長尺の動画やライブ配信から魅力的なハイライトを抽出し、文字起こし、AI分析、字幕・カバー付きの自動クリップ生成を提供する自動化AIパイプラインです。
marcelo-earth/generative-manim
Generative Manim は、LLM(GPT‑4o、Claude、Geminiなど)を使用して、プレーンな英語のプロンプトを実行可能なManimアニメーションコードとレンダリング済み動画に変換するオープンソースツールです。Webデモ、REST API、ローカルレンダリング対応のデスクトップアプリ(Animo)を提供し、オープンウェイトモデルの微調整用のトレーニングパイプラインとベンチマークスイートも備えています。
chenfengxu714/StreamDiffusionV2
単一およびマルチGPU環境でスループットとレイテンシを最適化する、リアルタイムストリーミング動画生成のインタラクティブな拡散パイプライン。
louisedesadeleer/clipify
長尺のトーキングヘッド動画を、自動リフレーミングと字幕機能付きの短いSNS向けクリップに自動変換するClaude Codeスキル。
yaoyao-jpg/PhiZero
PhiZero は、結果を動画としてレンダリングする前に、離散的な物理言語で将来の物理的ダイナミクスについて推論するワールドモデルです。
Kosinkadink/ComfyUI-AnimateDiff-Evolved
高品質なAIアニメーションを無限の長さで作成でき、モーションとサンプリングに対して広範な制御が可能な、ComfyUI向けの高度な AnimateDiff 統合です。
WeChatCV/Stand-In
追加パラメータのわずか1%を訓練することで、高い被写体一貫性を維持する、軽量で即時接続可能なアイデンティティ保持型動画生成フレームワーク。
Lixsp11/sekai-codebase
Sekaiは、世界の探索と生成のために、5,000時間以上の注釈付き一人称視点およびドローン映像を備えた高品質なエゴセントリック・ビデオデータセットです。
AMAP-ML/DreamX-World
DreamX-Worldは、イベントプロンプトを通じてユーザーが環境を探索・変換できる高精細で制御可能なシミュレーションを生成する汎用的なインタラクティブな世界モデルです。
zju3dv/street_crafter
StreetCrafterは、制御可能な動画拡散モデルと3Dガウススプラッティングを活用して、新しい軌道から現実的な動画を生成するためのフレームワークです。
Vchitect/Latte
高品質な動画生成を実現する潜在拡散Transformerで、テキストから動画およびテキストから画像の両方のタスクをサポートします。
Orkas-AI/Orkas-VideoStudio
読みやすく編集可能なプランファイルを通じて、AIコーディングエージェントが動画の構成、編集、生成を行うことを可能にするツールキット。自動動画制作の決定論的パイプラインを提供します。
thu-ml/DiT-Extrapolation
位置エンコーディングの外推によって、より長い動画や高解像度の画像を生成可能にする、Diffusion Transformers 用のプラグアンドプレイ・フレームワーク。
barefootford/buttercut
Final Cut Pro、Premiere、DaVinci Resolve などのプロフェッショナルなソフトウェア用に XML カットを生成する AI 動画編集エージェント。映像の初期アセンブリを自動化します。
alibaba/Tora
Toraは、テキスト、視覚、軌道ベースのガイドを使用して、オブジェクトの動きを正確に制御できる軌道指向型拡散変換器(Diffusion Transformer)による動画生成を可能にする。
Kevin-thu/StoryMem
StoryMemは、メモリ条件付き拡散モデルを用いて、一貫したキャラクターを備えた長編で連続性のあるナラティブ動画を生成するマルチショット動画生成フレームワークです。
wernerturing/multi-delogo
自動検出機能付きで、動くロゴも処理可能な動画のロゴ・透かし除去アプリケーション。
ossrs/oryx
Oryxは、字幕化とダブリングに統合されたAI機能を備えたライブストリーミングおよびWebRTCサービスを構築するための、ワンストップオープンソースの動画ソリューションです。
Agions/splicr
RustベースのAI動画ナレーションエンジン。マルチエージェントシステムを使用して、CapCutエクスポート用のシーン分析、脚本作成、音声クローン、タイムライン調整を自動化します。
IgorShadurin/app.yumcut.com
TikTok、YouTube Shorts、Instagram Reels 用のスクリプト、ボイスオーバー、ビジュアル、字幕を自動生成するオープンソースの AI 短期動画生成ツール。
NevermindNilas/TheAnimeScripter
アニメ専用のAI駆動動画強化ツールキットで、1回の処理でアップスケーリング、フレーム補間、修復を実現する。
showlab/Kiwi-Edit
Kiwi‑Editは、自然言語による指示(およびオプションの参照画像)を使用して、ビデオ全体を編集できるオープンソースのビデオ編集システムです。マルチモーダルLLMエンコーダとビデオ Diffusion Transformerを融合させ、スタイル転移、オブジェクトの追加/置換/削除、背景変更などの機能を提供します。本リポジトリは、完全なトレーニング・スクリプト(Qwen2.5‑VL‑3B + Wan2.2‑TI2V‑5Bを用いた三段階のカリキュラム学習)、学習済み Diffusers チェックポイント、および OpenVE‑Bench と RefVIE‑Bench での評価パイプラインを提供します。
Anil-matcha/Seedance-2-API
ByteDanceのSeedance AI動画生成器用のPythonラッパーで、リアルな人間の顔とキャラクターの一貫性を重視した高精細なテキストから動画、画像から動画の生成を可能にします。
simchowitzlabpublic/nano-world-model
拡散強制に基づく動画ワールドモデルの学習に向けたミニマルなフレームワーク。将来の動画予測、3D再構成、ロボット計画に利用可能。
microsoft/LatentSpatialMemory
3Dシーンの内容を潜在トークンとして保存し、RGBレンダリングの繰り返しを回避することで生成速度を向上させ、メモリオーバーヘッドを削減するビデオワールドモデル用のフレームワーク。
TencentARC/VerseCrafter
VerseCrafterは、4D幾何制御とGeoAdapterを使用して、現実的な動画におけるカメラと複数オブジェクトの動きに対して、正確かつ解釈可能な制御を提供する制御可能な動画ワールドモデルです。
nvidia-cosmos/cosmos-predict1
将来の状態予測に特化した世界基盤モデル(WFMs)のスイート。テキストまたは動画プロンプトから視覚的シミュレーションを生成し、Physical AI の開発を支援します。
Tencent-Hunyuan/HY-WorldPlay
HY-World 1.5 は、ユーザー入力に基づいて幾何学的に一貫した3D環境をストリーミング動画拡散によってリアルタイムで生成するインタラクティブな世界モデリングフレームワークです。
Tencent-Hunyuan/HunyuanVideo-1.5
軽量な 8.3 億パラメータの動画生成モデルで、コンシューマー向け GPU 上で高品質なテキストから動画、画像から動画の合成を実現します。
JingyunLiang/VRT
VRTは、動画スーパーレゾリューション、デブラー、ノイズ除去、フレーム補間、空間時間SRを扱うTransformerベースのモデルであるVideo Restoration TransformerのPyTorch実装です。Temporal Mutual Self-Attentionと並列ワーピングを用いて長距離時間依存性を捉え、9つのベンチマークで最先端のPSNR向上を達成しています。リポジトリには事前学習済み重み、テストスクリプト、Colabデモ、標準動画データセットでの学習手順が含まれています。
caiyuanhao1998/Open-OmniVCus
OmniVCusは、深度やマスクなどのマルチモーダル制御条件の下で、特定の被写体を含む動画を生成するフィードフォワード型被写体中心の動画カスタマイズフレームワークであり、拡散Transformerを用いて実現されています。