ruvnet/ruflo

Ruflo は、Claude Code/Codex の周囲に完全なエージェント実行層を追加するオープンソースフレームワークです。100以上の専門エージェント、スワーム協調、永続的ベクトルメモリ、自己学習ループ、ゼロトラストフェデレーション、プラグインマーケットプレイス、マルチモデルチャット用Web UI を提供します。`npx ruflo init`(フルスタック)または Claude Code プラグイン(ライト)でインストール可能。

nexu-io/open-design

ブランドのデザインシステムに基づいて、コードエージェントがウェブプロトタイプ、プレゼンテーション、モーショングラフィックスを生成・レンダリングできる、オープンソースでローカル優先のデザインプラットフォーム。

ApodexAI/FrontierAgent

FrontierAgentは、自律型ReActエージェントまたは並列エージェントチームワークフローを実行できるオープンソースのターミナルベースランタイムです。サンドボックス化されたファイルシステム、ライブTUIタスクボード、非同期ユーザー介入、研究用の長期タスク向け組み込みベンチマークハーネスを提供します。`uv`でインストールし、任意のOpenAI互換モデルエンドポイント(無料のApodex-1.1サービスも含む)を指定して、`--mode react`で単一エージェント、`--mode agent_team`で協調的な並列エージェントを実行できます。プロジェクトはApache-2.0ライセンスです。

EverettFish/holo-card-studio

テキストまたは画像を、パララックス効果付きのインタラクティブな3Dホログラムカードに変換するCodexスキル。Three.jsによるウェブビューアと編集可能なBlenderプロジェクトを提供。

Comfy-Org/ComfyUI

正確なパラメータ制御で、画像、動画、音声、3Dモデルの生成に向けた複雑なワークフローを構築できる、モジュール式のノードベースAIエンジン。

Anil-matcha/Open-Generative-AI

コンテンツフィルターやサブスクリプション料金なしで、400以上のモデルを使用して画像、動画、音声を生成する、無制限のオープンソースAIスタジオ。

dramaclaw/dramaclaw

ノードベースのキャンバスと構造化された制作パイプラインというデュアルモードのワークフローを使用して、脚本を完成した映画に変換する、ソース公開の AI ドラマ制作パイプライン。

ahujasid/camera-to-blender

AIを使用して現実世界のオブジェクトの写真を 3D モデルに変換し、自動的に Blender にインポートするツールです。

yejy53/Editable-Design

プロンプトを、平坦化された画像ではなく、HTMLとセマンティックレイヤーを使用して、編集可能な構造化された視覚的デザインに変換する、コーディングエージェント駆動型のフレームワーク。

OpenDCAI/GameFactory-3A

複数のゲームエンジン向けに、コードエージェントを使用してゲーム要件を生産準備完了のアセットおよびエンジン対応コードに変換するオープンソースフレームワークです。

OpenSenseNova/SenseNova-U1

SenseNova‑Uは、テキストから画像生成、画像編集、VQA、混合生成をネイティブに処理できるオープンソースの8 Bパラメータ統合型マルチモーダルモデルファミリ(U1およびU1.5)です。NEO‑unifyアーキテクチャに基づき、別個の視覚エンコーダー/VAEを排除し、高品質な4K生成、強力なインフォグラフィックレンダリング、効率的な推論(LoRAおよびコミュニティ提供の8ビットGGUF量子化版を含む)を実現しています。リポジトリには学習コード、推論スクリプト、ベンチマーク、デプロイガイドがすべて含まれており、Apache 2.0ライセンスで利用可能です。

Tencent/WeMM-Embedding

テキスト、画像、動画、視覚的ドキュメントに対して統一された表現を提供し、高性能なクロスモーダル検索を可能にする、汎用マルチモーダル埋め込みモデルのファミリー。

Merserk/dlss5-visual-enhancer

ローカルのGradioインターフェースを介して、画像やビデオにNVIDIA DLSS 5 Neural RenderingおよびFrame Generationを適用するWindowsアプリケーション。

basketikun/infinite-canvas

無限キャンバス上で生成、編集、プロンプトライブラリを統合した、AI画像作成向けのオープンソースノードベースワークベンチ。

HBAI-Ltd/Toonflow-app

脚本作成、ストーリーボード作成から最終動画生成までを自動化するAI駆動のワークベンチ。短編ドラマ制作のワークフローを一貫して支援。

snapotter-hq/SnapOtter

画像、動画、音声、PDF、ドキュメント向けに200以上のツールを提供する自己ホスト型ファイル処理スイート。背景除去、OCR、音声認識などのローカルAI機能を搭載。

moeru-ai/airi

チャット、ゲームプレイ、複数のプラットフォームでの相互作用が可能なインタラクティブなAI仮想キャラクターおよびVTuberを作成できるオープンソースフレームワーク。

halcyon-video/halcyon-video

Jellyfin と Plex 向けの 3D 没入型ビデオストアインターフェース。あなたのメディアライブラリを歩き回れる 1990 年代のレンタルショップに変えます。

NoizAI/HelixWorld

HelixWorld 1.0 は、ユーザーが仮想カメラを動かすのに合わせて、動画と空間オーディオを同時に生成する即将公開のリアルタイムモデルです。一人称視点の動画/オーディオとゲームエンジンのキャプチャデータで訓練されており、因果的に次のフレームと音場を予測し、その後インタラクティブな速度に合わせてパイプラインを蒸留します。コード、重み、および技術レポートの公開が予定されており、プロジェクトは Apache-2.0 ライセンスで提供される予定です。

pipecat-ai/pipecat

音声とマルチモーダルAIエージェントのリアルタイム構築を可能にするオープンソースのPythonフレームワーク。マルチエージェントの調整と低遅延トランスポートをサポート。

Pinvou/pinvou-agent

Pinvou Agentは、LLMを使用して作業、デザイン、コーディングのための編集可能な成果物を作成するクロスプラットフォームのデスクトップAIアシスタントです。

Devin-AXIS/deepseek-design

DeepSeek Harness 用のネイティブなビジュアルデザインシステムで、AI が編集可能なウェブサイト、プレゼンテーション、動画を生成・手動で微調整できるようにします。

oil-oil/oil-motion

スクロール、マウスの動き、およびタッチに反応する、AI生成の連続的な動きをインタラクティブなウェブ要素に変換する、Agent駆動型のアニメーションスキル。

zenstory-ai/drama-skills

モジュール式エージェントスキルを用いて、アイデアや小説をスクリプト、ストーリーボード、プロダクションプロンプトに変換するAI駆動のショートドラマ制作ワークフロー。

chatfire-AI/huobao-drama

脚本生成、キャラクターデザインから最終的なビデオ合成に至るまで、ショートドラマの制作を効率化するAI駆動の自動制作プラットフォーム。

techjarves/Uncensored-Local-Studio

ハードウェアアクセラレーションを備えた、Stable Diffusion、LLM、Whisper、Kokoro TTSを統合した、ゼロ構成でオフラインのAIスタジオ。

OpenSenseNova/SenseNova-Skills

SenseNova‑Skillsは、画像生成、インフォグラフィック作成、Excel分析、ディープリサーチ、PowerPoint生成といったオフィス自動化機能をSenseNova LLMに追加するオープンソースのAgent‑Skillsコレクションです。OpenClawまたはhermes‑agentランタイムにスキルフォルダを配置し、SenseNova APIを設定すれば、シンプルな自然言語リクエストから洗練されたデータ駆動型レポートやデッキを生成できます。

darkzOGx/youtube-automation-agent

トレンド調査や脚本作成から動画制作、公開、分析に基づく最適化まで、YouTubeチャンネルのライフサイクル全体を自動化するオープンソースのAIエージェントシステムです。

buxuku/SmartSub

SmartSub(妙幕)は、オープンソースでクロスプラットフォーム対応のデスクトップアプリです。動画をダウンロードし、ローカルまたはクラウド音声認識(ASR)を実行、多数の翻訳サービスで字幕を翻訳、編集・校正、音声合成(ゼロショットボイスクラッキングを含む)を行い、最終的に字幕を動画にハードバーンインまたはマスクします。オフラインで動作し、GPU加速もオプションで利用可能。完全に無料で使用できます。

alchaincyf/huashu-design

AIエージェント向けのデザイン自動化スキルで、テキストプロンプトからプロフェッショナルなインタラクティブプロトタイプ、モーショングラフィックス、編集可能なプレゼンテーションデッキを生成します。

wide-trace/open-higgsfield

32 の異なる AI モデルを統一されたプロンプトインターフェースとユーザー提供の API キーを通じて利用できる、オープンソースで自己ホスト可能なスタジオ。

PurpleDoubleD/locally-uncensored

WindowsおよびLinux向けの即時利用可能なローカルAIスタジオで、検閲なしのチャット、画像および動画生成、コーディングエージェントを1つのクラウドなしデスクトップアプリに統合しています。

ljquan/opentu

Opentuは、継続的なAIタスク実行のために、マルチモデル生成とツール管理を1つのワークスペースに統合するキャンバスベースのAIアプリケーションプラットフォームです。

HKUDS/RAG-Anything

テキスト、画像、表、数式が混在したドキュメントをシームレスに処理・検索できる、ワンストップのマルチモーダルRAGフレームワークです。

google-deepmind/alphagenome

DNA配列の規制コードを解読するための統合モデルとAPI。遺伝子発現、スプライシング、クロマチン特徴を予測します。

mengxi-ream/read-frog

Read Frog はオープンソースのブラウザ拡張機能で、任意のウェブページに AI で駆動する翻訳、解説、音声合成、字幕翻訳、フラッシュカード作成、カスタム AI アクションを追加します。Chrome、Edge、Firefox に対応し、20 以上の LLM プロバイダーをサポート、リクエストをバッチ化してコストを削減し、語彙学習用の間隔反復システムも搭載しています。

SegFault42/HeliosGen

無限のノードベースキャンバス上で、AI画像および動画生成モデルをつなぐ、無料でオープンソースの視覚的ワークフロー構築ツール。

llm-as-a-verifier/llm-as-a-verifier

llm-as-a-verifier は、AIエージェント出力のための細粒度かつ確率的な検証器として大規模言語モデル(LLM)を変換するPythonフレームワークです。候補となる経路をスコアリングし、効率的な確率的ピボットトーナメントで best-of-N を選定。ステップバイステップで進捗を追跡し、マルチモーダル(画像)入力もサポート。複数のエージェントベンチマークで最先端の結果を達成。再現可能な評価スクリプト、キャッシュ最適化トークン使用量トラッカー、およびClaude Codeプラグイン(TurboAgent)によるシームレスな統合を含みます。

Blizaine/Maestro

LLMを使用して音楽ビデオや短編映画の自動計画と生成を行うディレクターモードを備えた、ワンクリックのAI動画、画像、オーディオスタジオ。

flatkey-ai/flatkey-cli

単一のAPIキーとクレジット残高を通じて、画像、動画、音声、テキストを生成できる、統合されたマルチモーダルAI生成のためのコマンドラインインターフェース。

ant-research/4DAnyone

4DAnyoneは、人物の単一カメラ映像を、数十の同期的かつ視点一貫性のある動画(6〜24〜48視点)に変換する研究用ニューラルモデルで、下流の4Dガウススプラッティング再構成に使用できます。コンシューマーグラフィックスカード(最大24GB VRAM)で動作し、高速なディスティル版Turboモデル(5.6倍高速化)を提供。推論スクリプトとnerfstudio統合も用意されています。

jtydhr88/ComfyTV

画像、動画、音声、音楽、3DアセットのためのAI生成とプロフェッショナル編集ツールを統合した、ComfyUI用のキャンバスベースメディアワークベンチです。

livekit/agents

視覚、聴覚、理解が可能なリアルタイムでマルチモーダルな音声エージェントを構築するためのフレームワークで、ジョブスケジューリングの統合と柔軟なモデル統合を備えています。

ningzimu/image-to-editable-ppt-skill

テキスト、図形、およびアセットを再構成することで、画像、PDF、および画像ベースのスライドを編集可能なPowerPointプレゼンテーションに変換するマルチエージェントAIスキル。

mnemosyne-oss/mnemosyne

Mnemosyne は、ローカルファーストでSQLiteをバックエンドに持つAIエージェント向けのメモリレイヤーです。3段階のアーキテクチャ(作業メモリ、エピソードメモリ、時間的知識グラフ)により、セッション間で持続的なメモリを提供し、意味的/キーワードハイブリッド検索、高度なベクトル圧縮、Python SDK、CLI、組み込みMCPサーバーを備えています。プライバシーに重点を置き、テレメトリなし、デフォルトでローカル、クライアント側暗号化同期をオプションで提供しています。

wiltodelta/remove-ai-watermarks

AI生成画像や動画から可視ラベル、不可視ピクセル透かし、AI出所メタデータを除去するライブラリおよびCLIツール。

NomaDamas/CozyClay

Model Context Protocol を通じた直接的なAI制御を備えた、シーンのブロッキングとAI生成モーションのシーケンシングに特化したブラウザベースの3Dステージングスタジオ。

lipku/LiveTalking

リアルタイムで音声と映像を同期する、生々しいAI駆動の会話が可能なデジタル人間用のリアルタイムインタラクティブストリーミングエンジン。