AaronFeng753/Waifu2x-Extension-GUI

幅広いハードウェアとニューラルネットワークモデルをサポートする、AI駆動の画像および動画の拡大・フレーム補間用のグラフィカルユーザーインターフェース。

JuneYaooo/gpt-image2-ppt-skills

gpt-image2-ppt-skills は、OpenAIの gpt‑image‑2 モデルを使用して高品質な 16:9 スライド画像を生成し、それを .pptx ファイルにパッケージ化する Python スキルです。ビジュアル優先モードと、オプションの編集可能モード(ネイティブPowerPointオブジェクトに再構築)をサポートします。ユーザーは自然言語プロンプトで新しいデッキを作成、既存の .pptx テンプレートをクローン、または特定のスライド要素を編集できます。インストールは、対応エージェントにスキルをインストールするか、提供されたスクリプトを実行することで行います。OpenAI APIキーとローカルのPowerPoint/Keynote/LibreOfficeレンダラーが必要です。プロジェクトは Apache‑2.0 ライセンスです。

kleinlee/DH_live

GPUを必要とせず、モバイルブラウザや低消費電力デバイスでリアルタイムのアニメーションと会話が可能な、軽量な2Dデジタル人間エンジンです。

open-compass/VLMEvalKit

70以上のベンチマークと200以上のモデルにわたって、一つのコマンドで評価を可能にする、大規模視覚言語モデル用のオープンソース評価ツールキット。

SeemSeam/claude_codex_bridge

CCB(Claude‑Codex‑Bridge)は、クロスプラットフォームのターミナルUIで、多くのLLMベースのCLIエージェント(Codex、Claude、Geminiなど)を可視ペインで一緒に実行し、コラボレーショングラフを定義し、プロジェクト全体のメモリファイルを共有し、Androidアプリからワークスペースを制御することもできます。npmでインストールし、内蔵UIで設定し、コマンドラインからプロバイダー、ロール、リッチメディアターミナルを管理します。

JimLiu/baocut

AIコーディングエージェントが自然言語で BaoCut を制御し、自動的にビデオの音声認識、字幕翻訳、タイムライン編集を行うためのエージェントスキルです。

PhiloLabs/fable51-worlds

AIエージェント群を使用して、テキスト、画像、または動画から歩行可能な3Dワールドを生成し、ブラウザベースのThree.jsアプリケーションとしてレンダリングするシステム。

QwenLM/Qwen3.8-Flash-Next

Qwen4のアーキテクチャの初期プレビューとして、コーディングおよびオフィス作業において高い効率性を実現するマルチモーダルMoEモデル。トレーニングおよび推論コストを大幅に削減しています。

amitshekhariitbhu/build-your-own-x-machine-learning

純粋な Python で、ゼロから実装した古典的な機械学習アルゴリズム、ディープラーニングモデル、応用プロジェクト(レコメンデーションシステム、コンピュータビジョンアプリ、NLP など)のコレクションです。機械学習技術の内部構造を理解したいすべての人向けのハンズオン学習リソースとして設計されています。

DrEAmSs59/CS2-insight-agent

CS2用のワンストップクリエーションスイートで、デモ分析、OBSによるハイライト録画、AIによる解説付きの動画編集を自動化します。

redai-studio/Relax

Relaxは、マルチモーダル大規模言語モデル向けのオープンソース、Ray‑Serveベースの強化学習フレームワークです。TransferQueueを用いてロールアウトとトレーニングを分離し、GPUクラスタ上で完全非同期またはハイブリッド実行をサポート。PPO、GRPO、M2‑PO、RLOO、REINFORCE++など、豊富なオンポリシーアルゴリズムとプラグイン可能な報酬を備え、Megatron‑LMトレーニングバックエンドとSGLang推論を統合。テキスト、視覚、動画、音声を単一パイプラインで処理。公式Dockerイメージ、バイリンガルドキュメント、プロダクションレベルのオペレーション(ヘルスマネージャ、メトリクス、エラスティックロールアウトスケーリング)により、Qwen‑3‑Omniなどのモデルの研究および大規模ファインチューニングに即戦力として利用可能。

apple-aiml-research/ml-mobileclip

MobileCLIP (および MobileCLIP2) は、モバイルデバイス向けに最適化された、ゼロショット分類およびキャプション生成のための軽量・高速な画像・テキストモデルです。本リポジトリでは、事前学習済みチェックポイント、訓練/評価スクリプト (OpenCLIP ベース)、iOS デモ、および CoCa キャプションモデルを提供しており、すべて MIT / Apple research ライセンスの下で公開されています。

xr843/insect-world

外部3Dアセットではなく、パラメトリックなTypeScriptコードのみで生成された63種を収録した、インタラクティブな3D昆虫図鑑。

morettt/my-neuro

カスタマイズ可能な声、性格、Live2Dビジュアルを備えた、個人向けで人間らしいAIコンパニオンを作成する包括的なワークベンチ。

nexu-io/codex-slides

Codexコーディングエージェント向けのオープンソースAIスライドスタジオ。プロンプト、リポジトリ、またはファイルを、制御可能でライブ編集可能なワークフローを通じてプロフェッショナルなプレゼンテーションに変換します。

ArcInstitute/state

細胞の摂動に対する反応を予測し、細胞埋め込み(embeddings)を生成して生物学的状態遷移をモデル化するためのフレームワーク。

HisMax/RedInk

1つの文章から、アウトライン、コピーライティング、視覚的に一貫した画像を含む、完全なマルチページ・ソーシャルメディア投稿を生成するAIツール。

GetStream/Vision-Agents

リアルタイムのビデオストリーミングと LLM、コンピュータビジョンモデルを組み合わせ、インタラクティブなビジュアル体験を実現する低遅延・マルチモーダル AI エージェント構築用フレームワーク。

TEN-framework/ten-framework

低レイテンシー音声、テキスト、視覚機能を備えたリアルタイムマルチモーダル会話型AIエージェントを構築するためのオープンソースフレームワーク。

SakuraMathcraft/LaTeXSnipper

OCR を使用してスクリーンショット、画像、PDF を編集可能な LaTeX 数式およびテキストに変換するデスクトップアプリケーション。

microsoft/mcp-gateway

MCP Gateway は、Model Context Protocol (MCP) サーバーのためのオープンソースの Kubernetes-native なリバースプロキシおよび管理レイヤーです。MCP adapters と tools を作成、更新、監視するための REST control-plane を提供し、session-aware routing、Azure Entra ID RBAC、組み込みの React ポータル、およびオプションの LLM 駆動エージェントを提供します。Docker/K8s でローカルに展開、またはワンクリックの Azure テンプレートで展開可能です。

KangLiao929/Puffin

カメラ中心の空間知能と、物理・幾何・外観のネイティブな3D世界状態を利用した3D世界生成を可能にする、3D世界モデリングのための一連の統一マルチモーダルモデル。

nv-tlabs/lyra

NVIDIAによる、単一の画像または動画から3Dおよび4Dシーンを生成する一連のオープンな生成型3D世界モデル。

dmMaze/BallonsTranslator

ディープラーニングを活用したコミック翻訳ツール。漫画やコミックのテキスト検出、OCR、補間、翻訳を自動化します。

google-deepmind/gemma

Gemmaファミリーのオープンウェイト大規模言語モデルをデプロイおよび微調整するためのJAXライブラリ。マルチモーダル会話と複数のハードウェアバックエンドをサポート。

EvolvingLMMs-Lab/lmms-eval

LMMs‑Eval は、視覚/音声機能を持つ大規模言語モデルを評価するためのオープンソースPythonツールキットです。100以上のマルチモーダルベンチマークタスク(画像、動画、音声)を統合し、決定論的で統計的に信頼できる結果を提供。vLLM、SGLang、OpenAI互換APIを介して30以上のモデルファミリーをサポート。Web UI、HTTP評価サーバー、拡張可能なモデル/タスクインターフェースを備えています。

Lynpoint/CyberVerse

音声対話、ペルソナメモリ、単一の写真からのビデオアニメーションを組み合わせた、リアルタイムのデジタルヒューマンエージェントを構築するためのオープンソースフレームワーク。

duixcom/Duix-Mobile

モバイルおよび組み込みデバイス上で、低遅延かつオンデバイス実行でリアルタイム対話型AIアバターをデプロイするためのオープンソースSDK。

momori777/Artemis

完全ローカルで検閲のない AI コンパニオンシステム。LLM、TTS、画像生成、Live2D アニメーションを統合し、プライベートでキャラクター駆動の仮想パートナーを作成します。

chatfire-AI/huobao-canvas

Huobao Canvas は、オープンソースのノードベースのビジュアルエディターで、11 のプロバイダーからのテキスト、画像、ビデオ AI モデルを無限キャンバス上でチェーンできます。永続化と非同期実行キューのための軽量な Node サーバー、Docker および Electron のデプロイメントオプション、Huobao によるワンキーセットアップを提供します。コードを書かずにマルチモーダルなクリエイティブパイプラインを構築するのに最適です。

MirroS-Lab/Code-as-World

Code-as-Worldは、反復的シミュレーションを通じて世界の表現を発見することで、AIモデルが定量的な物理的推論を行うことを可能にする、物理世界を実行可能なコードとして表現するフレームワークです。

IBM/AssetOpsBench

AssetOpsBenchは、センサー、作業依頼、故障モードなどの産業資産管理データを扱うLLMベースのAIエージェントの構築、オーケストレーション、評価に向けたオープンソースベンチマーク/フレームワークです。ドメイン固有のMCPツールサーバー、複数のReActスタイルエージェントバックエンド、141以上の現実的なシナリオ、KDD/AAAI/NeurIPSコンペティションで使用された多次元評価パイプラインを提供しています。

Kiri-Innovation/3dgs-render-blender-addon

高精細な3Dキャプチャを標準的な3D制作ワークフローに統合するための、Blenderアドオン。3Dガウシアンスプラットのインポート、編集、アニメーション、レンダリングを可能にする。

Runfusion/Fusion

Fusionは、自然言語によるタスク記述を完全にレビューされ、マージ可能なコードに変換するオープンソースのAI駆動型ソフトウェア工場です。LLM駆動のエージェント群を統合し、各タスクを個別のGit worktreeで実行し、カスタマイズ可能なワークフローと人間の監視を備えた視覚ダッシュボードで全体プロセスを提示します。

ArtificialAnalysis/Stirrup

Stirrupは、LLM駆動型エージェントを構築するための軽量なPythonフレームワークです。コード実行、ウェブ検索、ファイルI/O、マルチモーダル処理などの既製ツールと、柔軟な`Tool`/`ToolProvider`システムを提供し、コンテキスト制限やセッションのライフサイクルを自動的に管理します。`pip install stirrup`(Dockerやブラウザなどのオプション拡張あり)でインストールし、クライアント(OpenRouter、LiteLLM、またはOpenAI互換API)を作成して`Agent`をインスタンス化し、モデルがタスク解決のためにツールを呼び出せるセッションを実行します。カスタムツールやプロバイダーの追加も容易なため、迅速なプロトタイピング、ドメイン特化型アシスタント、ツール使用エージェントの研究に適しています。

zyddnys/manga-image-translator

マンガやコミック内のテキストを検出し、削除し、置換するAI搭載の画像翻訳ツール。多言語対応および自動タイポグラフィ(文字配置)機能を備えています。

DavidVentura/offline-translator

デバイス上のモデルを使用して、テキスト、PDF/ODTドキュメント、および画像の翻訳を完全にオフラインで行うAndroid翻訳アプリ。

P1kaj1uu/ChattyPlay-Agent

ChattyPlay‑Agentは、AIチャットアシスタント(ChatGPT/DeepSeek)と日常的なツール群(音楽ストリーミング、動画解析、金価格チャート、学術論文閲覧、LaTeX/Markdownエディタ、マインドマップ、マンガライブラリ、Xianyuマーケットプレイスヘルパー、テキストから画像生成)を統合したフルスタックWebアプリです。React + TypeScriptフロントエンドとPython/Javaバックエンドで構築され、Docker経由で動作し、オンラインデモも提供されています。このリポジトリはAIアシスタント分野における本格的なソフトウェアプロジェクトです。

RunMaestro/Maestro

Maestroは、Gitワークツリー対応、プレイブック自動化、キーボード優先UI、リモートWeb制御、分析機能を備えたクロスプラットフォームデスクトップアプリで、Claude Code、OpenAI Codexなど多数のAIコーディングエージェントを並列で実行・自動化・監視できます。AGPL-3.0ライセンス下で提供されています。

Tencent-Hunyuan/UniRL

UniRLは、統一された強化学習ループを多くのマルチモーダル生成モデル(LLM、ビジョン・言語モデル、画像/動画拡散、ハイブリッドAR-拡散モデル)に適用するオープンソースのPythonフレームワークです。4つのエントリポイント、Hydraベースの設定、プラグイン可能なロールアウトエンジン、およびRayとFSDPによる分散トレーニングを提供します。リポジトリには標準的なRLアルゴリズムと、チームが提案した3つの新規手法(Flow-DPPO、DRPO、CPPO)のチュートリアルが含まれています。対応モデルにはStable Diffusion 3、FLUX.2-Klein、Qwen-3、HunyuanVideoなどが含まれます。ドキュメント、例レシピ、WeChatコミュニティが提供されています。Apache-2.0ライセンス。

liyue-aigc/female-outfit-director

AIエージェント向けのプロンプト指向ワークフローで、構造化された本番計画とキャラクター一貫性のある衣装変更動画の作成プロンプトを生成します。

mlfoundations/open_clip

OpenCLIPは、OpenAIのCLIPおよび多くの新しいマルチモーダルモデル(SigLIP、CoCa、MaMMUT、CLAP、NaFlex対応のビジョン/オーディオ、最新のテキストタワー)を実装するオープンソースのPyTorchライブラリです。事前学習済みチェックポイント、分散/FSDP2対応の柔軟な訓練スタック、混合精度およびtorch.compileアクセラレーション、ゼロショット推論と生成型キャプション生成のためのユーティリティを提供します。

YGYOOO/WorldX

WorldX は、単一のテキストプロンプトから自律的なエージェント、マップ、そしてエメルジェントな物語を含む完全な仮想世界を生成するAI駆動のシミュレーションエンジンです。

huangserva/3DCellForge

複数のAIプロバイダーを活用して画像をインタラクティブな3Dモデルに変換し、プロフェッショナルな検査・プレゼンテーション環境を提供するAI駆動の3Dモデルスタジオ。

nv-tlabs/3dgrut

ガウスラスタライゼーションとレイトレーシングを組み合わせたハイブリッド3Dレンダリングフレームワークで、歪みのあるカメラと反射・影などの複雑な光効果をサポートします。

Scottcjn/bottube

AIエージェントと人間が短編動画を共同で作成・共有するAIネイティブな動画プラットフォーム。Proof of Physical AIによるハードウェア検証済みプロヴァンスを特徴とする。

microsoft/DebugMCP

DebugMCPはMicrosoftのVS Code拡張機能で、ローカルなMCPサーバーを実行し、デバッグ操作(開始/停止、ステップ実行、ブレークポイント、変数の確認、式の評価)をツールとして公開します。Copilot、Cursor、CodexなどMCP互換のAIアシスタントが呼び出せます。多くの言語で即時対応し、ポート3001で完全にローカルで動作し、ループバック専用バインディング、ホスト検証、シークレットマスクなどのセキュリティチェックを備えています。併用される *debug-live* スキルにより、AIエージェントがVS Code内ですべてのデバッグを自律的に実行できるようになります。

ganbo-gab/open-storyboard-canvas

Open Storyboard Canvas は、オープンソースでクロスプラットフォーム対応のデスクトップアプリ(Tauri + React + Rust)であり、AI生成画像・動画・3Dストーリーボードシーン用の視覚的ノードキャンバスを提供します。チャットベースのCanvas Agent(ベータ)を備え、生成タスクの作成・編集・追跡が可能で、OpenAI互換、Claude、Dreamina CLIなど複数のプロバイダーに対応。ディレクタースタジオツール、プロンプトライブラリ、一括インポート、詳細ログを提供。MITライセンス、Storyboard-Copilot上流プロジェクトに基づく。