latent-spaces/brag
Hyperframesを使用して、ソフトウェアプロジェクトを音楽とモーション付きの短い共有可能なローンチビデオに自動変換するClaude Codeスキル。
TauricResearch/TradingAgents
TradingAgentsは、LangGraphベースのオープンソースフレームワークで、複数のLLM駆動エージェント(財務分析、センチメント、ニュース、テクニカル、リサーチャー、トレーダー、リスク、ポートフォリオ)を統合して、フルスタックの仮想トレーディングファームをシミュレートします。数十のLLMプロバイダーをサポートし、時系列の市場データ(SEC EDGAR、FRED、Yahoo Finance、ソーシャルセンチメント)を取得し、チェックポイント付きグラフ実行を提供し、継続的学習のための意思決定ログを記録し、複数のティッカーと日付でパフォーマンスを評価するバックテストCLIを備えています。研究目的のためのものであり、投資アドバイスではありません。
wide-trace/open-higgsfield
32 の異なる AI モデルを統一されたプロンプトインターフェースとユーザー提供の API キーを通じて利用できる、オープンソースで自己ホスト可能なスタジオ。
ApodexAI/FrontierAgent
FrontierAgentは、自律型ReActエージェントまたは並列エージェントチームワークフローを実行できるオープンソースのターミナルベースランタイムです。サンドボックス化されたファイルシステム、ライブTUIタスクボード、非同期ユーザー介入、研究用の長期タスク向け組み込みベンチマークハーネスを提供します。`uv`でインストールし、任意のOpenAI互換モデルエンドポイント(無料のApodex-1.1サービスも含む)を指定して、`--mode react`で単一エージェント、`--mode agent_team`で協調的な並列エージェントを実行できます。プロジェクトはApache-2.0ライセンスです。
spinabot/brigade
Brigadeは自己ホスト型のマルチエージェントAIアシスタントフレームワークです。Tidelineと呼ばれる永続的で証明可能な記憶を共有するエージェントチームを、組織図形式で構成でき、ターミナルUI、WhatsApp、Slack、Discord、iMessageなど、さまざまなチャネルからアクセス可能です。すべてのAPIキーとデータはあなたのマシン上に留まります。Claude、OpenAI、Gemini、ローカルのOllamaなど、任意のLLMを接続でき、Composio経由で1,000以上のサードパーティアプリに接続可能です。スキル、サブエージェントのファンアウト、cronスケジューリング、ドキュメント/メディア処理、オプションのConvexストレージ、MCPメモリサーバーなどの機能を備えています。1行スクリプトまたはnpmでインストール後、オンボーディングし、常に稼働するゲートウェイを起動してチャットを開始できます。
nexu-io/open-design
ブランドのデザインシステムに基づいて、コードエージェントがウェブプロトタイプ、プレゼンテーション、モーショングラフィックスを生成・レンダリングできる、オープンソースでローカル優先のデザインプラットフォーム。
yi1108/printfilm
テンプレート駆動型のパイプラインにより、ストーリーボード作成、画像/動画生成、ナレーションの自動化を実現するオープンソースのAIスタジオ。短編動画と連載漫画の制作を支援します。
Comfy-Org/ComfyUI
正確なパラメータ制御で、画像、動画、音声、3Dモデルの生成に向けた複雑なワークフローを構築できる、モジュール式のノードベースAIエンジン。
docling-project/docling
Doclingは、PDF、Word、スライド、スプレッドシート、電子書籍、音声、動画、メール、画像、多数のXMLスキーマなど、膨大なドキュメント形式を解析するオープンソースのPythonライブラリです。AI駆動のレイアウト解析、OCR、視覚言語モデル理解、音声からテキストへの変換を追加し、統一された`DoclingDocument`を出力します。このドキュメントはMarkdown、HTML、JSON、DocLang、DocTagsなどにエクスポート可能で、LangChain、LlamaIndex、Crew AI、Haystack、またはカスタムエージェントにMCPまたはREST API経由で直接統合できます。プライバシーに配慮したデータにはローカルで実行可能であり、CLIおよびサービスモードも提供するため、RAGパイプライン、企業知識ベース、金融・法務文書処理、マルチモーダルAIエージェントの構築に最適です。
higgsfield-ai/higgsfield
higgsfield は、巨大な LLM のためのオープンソース GPU ノードマネージャーおよびトレーニングフレームワークです。ノード割り当て、ZeRO-3/FSDP シェーディング、ジョブキュー、GitHub Actions に基づくデプロイを処理し、単純な Python デコレータで LLaMA-70B などのモデルをクラスタでトレーニングできます。
milind-soni/OpenMausBot
OpenMausBot は、複数のAIエージェント(Claude、Codex、Grok、または任意の互換CLI)を連絡先として管理できるデスクトップチャットアプリです。各ボットは小さなハーネスサーバー経由でローカルで実行され、クラウドまたはローカルコンピュータを制御可能で、Composio を通じてサードパーティアプリと接続できます。UIにはモデル切り替え、危険な操作の承認ダイアログ、ElevenLabs による音声出力、マーカドダウンベースのチームインポート機能があります。macOS、Windows、Ubuntu で動作し、外部サービスを有効にしない限りすべてのデータはローカルに保存されます。
ruvnet/ruflo
Ruflo は、Claude Code/Codex の周囲に完全なエージェント実行層を追加するオープンソースフレームワークです。100以上の専門エージェント、スワーム協調、永続的ベクトルメモリ、自己学習ループ、ゼロトラストフェデレーション、プラグインマーケットプレイス、マルチモデルチャット用Web UI を提供します。`npx ruflo init`(フルスタック)または Claude Code プラグイン(ライト)でインストール可能。
krillinai/OpenCreator
OpenCreatorは、Codexベースの会話型エージェントと、マルチモーダルコンテンツ作成(動画翻訳、ダウンロード、サムネイルおよび画像生成)用の視覚ダッシュボードを統合したオープンソースでローカル実行可能なAIワークスペースです。バージョン管理されたワークフロー、ローカルデータストレージ、同じWeb UIを基盤とするデスクトップクライアントを提供します。多数のLLM、Whisper、GPT-Image、およびその他の音声/翻訳サービスに対応。クラウド専用プラットフォームに依存せずにAI支援メディア制作を希望するクリエイターおよび小規模チーム向けに設計されています。
ahujasid/mcp-for-blender
LLMをBlenderに接続するMCPベースの統合により、プロンプト駆動の3Dモデリング、シーン操作、アセット統合を可能にします。
Anil-matcha/Open-Generative-AI
コンテンツフィルターやサブスクリプション料金なしで、400以上のモデルを使用して画像、動画、音声を生成する、無制限のオープンソースAIスタジオ。
gzxx-2025/aid-studio
AI映画、ドラマ、漫画の制作のための、脚本作成、ストーリーボード、画像/動画生成、吹き替えを単一のワークフローに統合した、セルフホスト型AI制作プラットフォームです。
microsoft/playwright-mcp
Playwright MCP は、LLM ベースのエージェントが Model Context Protocol を介して Playwright ブラウザを制御できるようにする Node.js サーバーです。スクリーンショットの代わりに構造化されたアクセシビリティスナップショット(JSON)を返すため、トークン効率が高く、決定的な Web 自動化と永続的なブラウザ状態を実現します。
ZJU-REAL/Easel
Easelは、ソーシャルメディアクリエイター向けのオープンソースAI駆動型コンテンツワークベンチです。OpenClaw LLMエージェント、アカウントごとのプロファイル、113以上の実行可能な「スキル」を組み合わせ、トレンドの発見、トピックの計画、テキスト・画像・音声・動画の生成、7つの中国プラットフォームへの直接投稿、そしてパフォーマンスデータをプロファイルにフィードバックして継続的に改善を行うことができます。
lixiaoxiao9888-create/manju-laoli-skill
AIエージェント向けの産業用AIGC作成ルールベース。Asset-Firstパイプラインを通じて、スクリプトを一貫性のあるモデル対応のビデオプロンプトに変換します。
basketikun/infinite-canvas
無限キャンバス、マルチモーダルAI生成、エージェントによるキャンバス操作を1つのワークスペースに統合したオープンソースAI画像作成ワークベンチ。
nilbuild/page-mascot
スプライトシートを使用して、ウェブサイトへインタラクティブなカーソル追跡マスコットを追加するためのReactコンポーネントとAI駆動のツールセット。
OpenSenseNova/SenseNova-U1
OpenSenseNovaのSenseNova‑U1シリーズは、NEO‑unifyアーキテクチャに基づくオープンソースでネイティブ統合マルチモーダルモデル(テキスト + 画像)です。高品質な4K画像生成、密度の高いテキストを含むインフォグラフィック作成、画像編集、VQA、テキストと画像を交互に配置したチュートリアル生成をサポートします。リポジトリにはトレーニングコード、事前学習済み8 Bパラメータのチェックポイント(コミュニティが量化したGGUFファイルを含む)、例題推論スクリプト、デプロイガイドが含まれており、すべてApache 2.0ライセンスの下で提供されています。
Devin-AXIS/deepseek-design
DeepSeek Harness 用のネイティブなビジュアルデザインシステムで、AI が編集可能なウェブサイト、プレゼンテーション、動画を生成・手動で微調整できるようにします。
chatfire-AI/huobao-drama
脚本生成、キャラクターデザインから最終的なビデオ合成に至るまで、ショートドラマの制作を効率化するAI駆動の自動制作プラットフォーム。
HBAI-Ltd/Toonflow-app
脚本作成、ストーリーボード作成から最終動画生成までを自動化するAI駆動のワークベンチ。短編ドラマ制作のワークフローを一貫して支援。
zenstory-ai/drama-skills
視覚的一貫性を重視しながら、アイデアや小説をスクリプト、ストーリーボード、動画プロンプトに変換する11のエージェントスキルからなるAI駆動型ショートドラマ制作ワークフロー
alesha-pro/tools
MiniMax H3 ビデオ・オーディオ生成向けに最適化されたマルチ GPU ワークフローと、AI エージェント向けの専門的なアニメーションスキルを備えたローカル AI ツールのコレクション。
v-modal/vmodal_sdk_flutter
動画と画像ライブラリ間で意味、発話、または画像に基づくマルチモーダル意味検索を統合するためのFlutter SDK。ユーザーは意味、音声、または画像で瞬間を検索できます。
omnigent-ai/omnigent
Omnigentは、Claude Code、Codex、Cursorなど多数のLLMコードエージェントを1つのCLIとWeb UIで統合するオープンソースのメタハーネスです。デバイスやクラウドサンドボックス間でエージェントを実行・結合・管理でき、組み込みのコラボレーションとポリシー機能を備えています。
darkzOGx/youtube-automation-agent
トレンド調査や脚本作成から動画制作、公開、分析に基づく最適化まで、YouTubeチャンネルのライフサイクル全体を自動化するオープンソースのAIエージェントシステムです。
ningzimu/codex-ppt-skill
記事、レポート、論文を画像ベースのPowerPointプレゼンテーションに変換するAIエージェントスキル。アウトラインを計画し、スタイル付きスライドを画像として生成し、それらを.pptxファイルに組み立てます。
EverettFish/holo-card-studio
テキストまたは画像を、パララックス効果付きのインタラクティブな3Dホログラムカードに変換するCodexスキル。Three.jsによるウェブビューアと編集可能なBlenderプロジェクトを提供。
xuanyustudio/LocalMiniDrama
スクリプト生成から最終動画合成まで、さまざまなAI APIを活用して制作プロセスを自動化する、オープンソースでローカル優先のAIショートドラマ作成ツール。
alchaincyf/huashu-design
AIエージェント向けのデザイン自動化スキルで、テキストプロンプトからプロフェッショナルなインタラクティブプロトタイプ、モーショングラフィックス、編集可能なプレゼンテーションデッキを生成します。
waooAI/waoowaoo
ブレインストーミングアシスタントと、AI生成アセットの整理と洗練のためのビジュアルキャンバスを組み合わせる、画像と動画のためのAIクリエイティブワークスペース。
Merserk/dlss5-visual-enhancer
NVIDIA RTX GPU 向けの Windows アプリケーションで、DLSS 5 と RTX Video テクノロジーを使用して、画像、動画、ライブストリームをアップスケール、強化、フレーム補間します。
Open-LLM-VTuber/Open-LLM-VTuber
オープンソースの音声インタラクティブ AI コンパニオンで、Live2D アバターと視覚認識を備え、完全にオフラインで動作し、プライベートなリアルタイム会話が可能です。
Swayingleaves/novanova-studio
創造的な文脈を維持するために、画像および動画生成を無限キャンバスに統合したAIエージェント駆動のビジュアル制作ワークベンチです。
yejy53/Editable-Design
Editable Visual Designは、LLM(Codex「Skills」経由)が自然言語の設計要件を、独立したテキスト、画像、レイアウト層を持つ完全に編集可能なグラフィック(HTMLページまたはPowerPointファイル)に変換できるようにするオープンソースツールキットです。研究用図表のための`paper-fig`、ポスターやインフォグラフィックのための`editable-design`、HTMLをPPTXに変換するための`html-to-pptx`という3つのスキルを提供します。このシステムはLLMの設計手順を記録(Agent Design Replay)し、ビジュアルエディタを提供することで、ローカルで編集可能なAI生成ドラフトを迅速に作成できます。
ningzimu/image-to-editable-ppt-skill
テキスト、図形、およびアセットを再構成することで、画像、PDF、および画像ベースのスライドを編集可能なPowerPointプレゼンテーションに変換するマルチエージェントAIスキル。
QwenLM/Qwen-MM-Plugins
Qwenモデル用のマルチモーダルプラグインのコレクション。AIエージェントが画像、動画、音声、3Dファイルをネイティブに処理でき、BlenderやFreeCADなどのソフトウェアを制御できるようにします。
techjarves/Portable-Local-Studio
Stable Diffusion、LLM、Whisper、Kokoro TTSを1つのハードウェアアクセラレートデスクトップインターフェースに統合したゼロ構成、オフラインAIスタジオ。
bytedance/UI-TARS-desktop
視覚認識と精密なGUI操作を通じて、デスクトップアプリケーションやウェブブラウザの自然言語制御を可能にするマルチモーダルAIエージェントスタック。
buxuku/SmartSub
SmartSub(妙幕)は、オープンソースでクロスプラットフォーム対応のデスクトップアプリです。動画をダウンロードし、ローカルまたはクラウド音声認識(ASR)を実行、多数の翻訳サービスで字幕を翻訳、編集・校正、音声合成(ゼロショットボイスクラッキングを含む)を行い、最終的に字幕を動画にハードバーンインまたはマスクします。オフラインで動作し、GPU加速もオプションで利用可能。完全に無料で使用できます。
xpzouying/xiaohongshu-mcp
自己ホスト型のMCPサーバーで、AIアシスタントが小紅書にログインし、投稿(画像または動画)、フィード検索、いいね/お気に入り、コメント、ユーザーまたは投稿の詳細取得が可能。バイナリ、Dockerイメージ、ソースビルドのいずれかで利用でき、Claude Code、Cursor、VS Code、Open Code、Clineなどと統合可能。
PurpleDoubleD/locally-uncensored
チャット、画像・動画生成、コーディングエージェントを1つの簡単にインストールできるアプリケーションに統合した、包括的なローカル AI スタジオです。
lightningpixel/modly
ユーザーの GPU 上で実行される AI モデルを使用して、写真を 3D メッシュに変換するローカルでオープンソースのデスクトップアプリケーション。
Tencent/WeMM-Embedding
WeMM‑Embeddingは、テキスト、画像、動画、視覚ドキュメントを1つのL2正規化ベクトルに変換する、騰訊(Tencent)のオープンソースマルチモーダル埋め込みスイート(2B/4B/9Bパラメータ)です。"マトリョーシカ"切り捨てにより、さまざまな出力次元をサポートし、🤗 TransformersおよびSentence‑Transformers用の即用推論スクリプトを提供。vLLMおよびSGLang用のサービングラッパーも含まれます。MMEB‑v2/v3ベンチマークでは、画像、動画、ドキュメント、テキスト、エージェントタスクで最先端のスコアを達成。モデルはHugging Faceにホストされ、Apache 2.0ライセンスで公開されています。