google-gemini/gemini-live-api-examples
Gemini Live APIの例のコレクション。マルチモーダル入力を備えた低遅延でリアルタイムの音声・動画AIエージェントの構築を可能にする。
X-PLUG/MobileAgent
視覚的知覚とプランニングを用いて、モバイル、デスクトップ、ウェブインターフェースにわたるタスクを自動化するマルチプラットフォームGUIエージェントおよび基盤モデルのファミリー。
YouMind-OpenLab/awesome-seedance-2-prompts
CC-BY-4.0ライセンスの下、6,405件のコミュニティ提出プロンプトを収集した、ByteDanceのSeedance 2.0マルチモーダル動画生成モデル用のキュレート済みコレクション。特集例、検索可能なWebギャラリー、貢献ガイドを備えています。
niedev/RTranslator
Whisper や NLLB などのデバイス内 AI モデルを使用する、Android 向けのオフラインでリアルタイムの翻訳アプリ。プライバシー保護された、インターネット不要の会話が可能。
HUANGCHIHHUNGLeo/claude-real-video
LLMのために意味のあるキーフレームと文字起こしを抽出するローカルビデオ処理パイプライン。固定間隔のサンプリングに代わる、インテリジェントなシーン変化検出を採用しています。
op7418/guizang-yingzao-skill
建築や文化の写真を、中国語のタイポグラフィと空間認識を統合したアートディレクションされたエディトリアルポスターに変換するAI駆動のデザインスキル。
fengshao1227/ccg-workflow
CCG-Workflow は Node.js CLI で、Claude Code を複数のコード生成モデル(Codex、Gemini など)の中心的なオーガナイザーにします。JavaScript フックを挿入してコンテキストを保持し、永続的なタスクフォルダを作成し、組み込み戦略(例:full-collaborate)を実行し、セキュリティ/品質ゲートを適用し、Baota パネルへのデプロイも可能。`npx ccg-workflow`(フルモード)でインストール、または Claude プラグインとして再利用可能なスキルのみを取得。
xberg-io/xberg
Xbergは、107種類のフォーマットからクリーンで構造化されたテキスト(OCR、テーブル、コード構造、およびオプションのLLM駆動拡張を含む)を抽出するオープンソースでRustベースのドキュメントインテリジェンスエンジンです。15言語のバインディング、CLI、Dockerイメージ、REST API、AIコーディングアシスタント向けMCPサーバを備えています。
GMGNAI/gmgn-skills
GMGN Skillsは、CLIコマンドを通じて、AIエージェントにリアルタイムのマルチチェーン・オンチェーンデータとミームトークンの取引機能を提供し、スクレイピングなしでの自動リサーチ、分析、実行を可能にします。
ooboqoo/interview-coder-cn
画面上の質問をリアルタイムで分析して回答を提供しつつ、画面共有ソフトウェアには見えない状態を維持する、AI駆動のスクリーンショットアシスタント。
taoufik123-collab/claude-watch
ClaudeがURLやローカルファイルからの動画を「見る」能力を提供するスキル。キーフレームと字幕を抽出することで、マルチモーダル分析が可能になります。
zilliztech/memsearch
memsearchは、AIコーディングアシスタントとの会話履歴をMarkdownとして記録し、ハイブリッド(BM25 + デンス)Milvusインデックスを構築するPythonライブラリおよびCLI。Claude Code、Codex、DeepSeek Harness、OpenClaw、OpenCodeなど複数のプラットフォームでプラグイン経由でクロスプラットフォーム検索を可能に。ローカルONNX埋め込みをサポート、オプションのZilliz Cloudバックエンド、バックグラウンドでのプロジェクト/ユーザーのメモ、自動的なスキル蒸留も実装。
argosopentech/argos-translate
Argos Translate は、オフラインでのニューラル機械翻訳のためのオープンソース Python ライブラリです。事前学習済みの OpenNMT モデルを「.argosmodel」ファイルとしてダウンロードし、中間言語を介したピボット翻訳をサポートし、CTranslate2 による GPU 加速を提供します。Python API、CLI、または個別のデスクトップ GUI を介して使用できます。また、このプロジェクトは LibreTranslate ウェブ/API サービスを支えています。
nyldn/claude-octopus
Claude Octopusは、Claude Code用のプラグインで、マルチLLMオーケストレーション層を追加します。`/octo:*`コマンドを実行するまで待機し、その後最大12の外部プロバイダー(Codex、Copilot、Ollamaなど)を呼び出して、合意ゲートレビュー、敵対的評議会、または完全な「仕様からソフトウェア」パイプラインを実行できます。数十のペルソナ、スラッシュコマンド、メソッド対応ワークフローを備え、永続的メモリツールと統合され、Claude Code、Codex CLI、Cursor IDE(MCPサーバー経由)、OpenCodeで動作します。
open-multi-agent/open-multi-agent
Open Multi‑Agent (OMA) は、Node.js アプリ内での動的 LLM エージェントチームのオーケストレーションを可能にする TypeScript フレームワークです。高レベルの目標から実行時にタスク DAG を構築し、人間の承認をオプションで実行し、全トレースを記録して検査・再実行可能にし、任意の LLM プロバイダー、ツールゲート、予算制御、OpenTelemetry 統合をサポートします。
Ch921-cell/Remember-R1
Remember-R1は、長期間の推論中に視覚情報を忘れないようにするための強化学習フレームワークです。
llm-as-a-verifier/llm-as-a-verifier
llm-as-a-verifier は、AIエージェント出力のための細粒度かつ確率的な検証器として大規模言語モデル(LLM)を変換するPythonフレームワークです。候補となる経路をスコアリングし、効率的な確率的ピボットトーナメントで best-of-N を選定。ステップバイステップで進捗を追跡し、マルチモーダル(画像)入力もサポート。複数のエージェントベンチマークで最先端の結果を達成。再現可能な評価スクリプト、キャッシュ最適化トークン使用量トラッカー、およびClaude Codeプラグイン(TurboAgent)によるシームレスな統合を含みます。
jingyaogong/minimind-v
単一のコンシューマー向けGPUで、わずか2時間で65Mパラメータのマルチモーダルモデルをトレーニングできる、Vision Language Model (VLM) の最小限の実装。
50kg/image-to-slice
アセットをインテリジェントにスライスし、背景をインペインティングすることで、フラットな UI 画像を編集可能な Figma レイヤーと HTML/CSS コードに変換する、AI 駆動の UI 分解ツール。
halcyon-video/halcyon-video
Jellyfin、Plex、Embyなどのメディアライブラリ向けの歩き回れる3Dビデオストアインターフェースで、デジタルカタログを没入型の物理的閲覧体験に変える。
Blizaine/Maestro
LLM主導のワークフローを使用して、ミュージックビデオや短編映画の制作を自動化する、ローカルAIクリエイティブスタジオおよびビデオエディター。
hero8152/Infinite-Canvas
複数の AI API とローカル ComfyUI ワークフローを統合した、視覚的で無限キャンバス型の共同作業用生成 AI コンテンツ制作環境。
JohnKinyanjui/sprite-maker
アイデンティティを保持するAIアニメーションと決定論的Rustベースのリギングエンジンを備えた、ローカル優先のAIワークベンチ。2Dゲームアートの作成、アニメーション化、エクスポートが可能。
shootthesound/Fizgig
コンシューマー GPU で AI 画像および動画モデルのファインチューニングと修復が可能な LoRA トレーニング・リファインメントスタジオ。
Adam-CAD/CADAM
AI を使用して自然言語と画像を OpenSCAD のパラメトリック 3D モデルに変換する、オープンソースのテキスト‑to‑CAD Web アプリです。
tover0314-w/opentypeless
macOS、Windows、およびLinux向けの、アプリを認識するディクテーション、音声Q&A、およびテキストの書き換えを提供するオープンソースのAI音声入力ツール。
MCPJam/inspector
MCPJam Inspector は、チャットベースのAI製品(ChatGPT、Claude、Cursor、Copilotなど)で使用される Model‑Chat‑Protocol (MCP) を実装するサーバー向けのオープンソーステスト・評価プラットフォームです。Webプレイグラウンド、OAuthデバッガー、サーバーデバッグツール、再利用可能な「スキル」、共有ワークスペース、評価テストケース実行エンジン、CLI、SDK、CI/CD統合を提供し、16種類のクライアント設定と170以上のLLMモデルでレグレッションを検出できます。
csyqlz/VOZEB-PRO
テキスト、画像、動画、音声の生成を統合した、ワンストップ型の商業用SaaSアプリケーションとしてのフルスタックAIクリエーションプラットフォーム。
AgnesAI-Labs/AgnesAI-Models
テキスト、画像、動画生成に向けた高性能マルチモーダル基盤モデルへのアクセスを提供する、統合的で OpenAI 互換の API ゲートウェイ。
penecho/penecho
PenEchoは、Model-Canvas-Protocol (MCP) を介してLLMエージェントと統合される視覚的キャンバスアプリです。手書きのノート、図、コードを描画・注釈・ウィジェット埋め込みでき、AIエージェントがキャンバスを読み取り、編集し、フィードバックを返すことで、会話と視覚作業の密接なフィードバックループを実現します。デスクトップアプリまたはnpmパッケージとして利用可能で、ローカルおよびクラウドホスティングモデルをサポートし、バージョン管理されたプロジェクト、共有機能、組み込みアシスタントを備えています。
oomol-lab/pdf-craft
スキャンされたPDFをOCRとLLMによる翻訳機能を使用して、編集可能なMarkdownまたはEPUBファイルに変換するPythonライブラリです。
digitalsamba/claude-code-video-toolkit
Claude Code と連携する AI ネイティブな動画制作ワークスペース。スクリプト作成、アセット生成、レンダリングを自動化し、低コストでプロフェッショナルな説明動画を生成します。
NomaDamas/CozyClay
AI動画生成のための高精度なリファレンス資産を作成するために、シーンのブロッキングとキャラクターのポージングを行うブラウザベースのプレビジスタジオ。
modstart-lib/aigcpanel
リップシンク、ボイスクラウンニング、オーディオビジュアルツールを統合した、AIデジタル人間用のワンストップデスクトップアプリケーション。
sokrypton/ColabFold
Google Colab とローカルインストールを介してタンパク質折りたたみ予測を誰でも利用可能にするツール。AlphaFold2 や AlphaFold3 などの複数のモデルとパブリック MSA サーバーを統合しています。
Blaizzy/mlx-vlm
MLX‑VLM は、Apple Silicon 上の MLX ランタイムを介して、視覚言語(およびマルチモーダル)モデルの推論、ファインチューニング、サービングを可能にする Python ライブラリです。CLI、FastAPI サーバー、Gradio チャット UI、および推測的デコード(DFlash、Gemma‑4 MTP、EAGLE‑3)などの高度な高速化技術を提供します。数十種類の事前ラッピング済みモデル、低ビット量子化、思考予算制御、および開発を容易にするエージェントスキルバンドルをサポートしています。
NVIDIA-NeMo/Nemotron
エージェントAI向けに設計されたオープンで高効率なマルチモーダルモデルとトレーニングレシピのファミリー。データキュレーションからデプロイまで、ライフサイクル全体をカバーするツールを提供します。
jordanrendric/claude-video-vision
ローカルまたはクラウドバックエンドを介してフレームの抽出と音声のトランスクリプト化により、動画理解を可能にするClaude Codeプラグイン。
Tencent-Hunyuan/HY-World-2.0
テキスト、画像、または動画から編集可能な 3D アセット(メッシュおよび Gaussian Splattings)を生成・再構築するマルチモーダルワールドモデルフレームワーク。ゲームエンジンでの利用を目的としています。
rome-os/rome
Romeは、人間とAIエージェントが永続的で自己ホスティング可能な環境で協働できるオープンソースの「エージェントOS」です。**Rome Apps**(git追跡されたパッケージ)を導入し、アクション、エージェント、スキル、UI、データを含む機能を単一のチャットを超えて維持します。Docker/Electronでローカル実行またはプレビュー版Rome Cloudを利用し、提供されたSDKでアプリを開発し、アプリストアで共有可能です。プラットフォームはモデルのプロンプトだけでなく、組み合わせ可能で再利用可能なソフトウェアに焦点を当てており、永続的エージェントサービスと個人用ソフトウェアプラットフォームの間の位置づけです。
ahujasid/camera-to-blender
AIを使用して現実世界のオブジェクトの写真を 3D モデルに変換し、自動的に Blender にインポートするツールです。
WecoAI/aideml
AIDE MLは、LLM駆動の木探索エージェントを実装するオープンソースのPythonライブラリで、機械学習パイプラインの自動作成、デバッグ、最適化を可能にします。ユーザーはデータセット、目標、評価指標を自然言語で指定するだけで、エージェントはコードを反復生成し、評価し、探索木を刈り込み、指標が最大化されるまで処理を続けます。このパッケージにはCLI、Streamlit UI、HTML可視化機能が含まれており、OpenAI互換LLM(Ollamaなどのローカルモデルも含む)と連携可能です。
mizorewww/course2md
音声認識を使用して、YouTube、Bilibili、およびローカル動画を図解付きのMarkdownまたはHTMLノートに変換するツール。
GenielabsOpenSource/spine-animation-ai
Spine 2D向けのAIパワードツールセットで、キャラクターのリギング、アセット配置、および生画像からのアニメーション生成を自動化します。
alibaba/lumenx
スクリプトを分析し、アセット生成と構成を統合されたパイプラインで行う、AIネイティブなモーションコミックおよび動画作成プラットフォーム。
anymouschina/TapCanvas
スクリプト、アセット、ストーリーボードをトレーサブルなワークフローに統合するエージェントネイティブな無限キャンバスで、AI映画およびマルチモーダルコンテンツ制作を実現します。
raojiacui/prompt-lens
既存の動画からプロンプトとスクリプトを抽出し、成功した AI 動画スタイルを再現・改善するための AI 動画分析ツール。
laravel/mcp
Laravel MCP は、AI クライアントが標準プロトコルを使って Laravel アプリのデータとロジックにアクセスできるようにする、準備完了済みの Model Context Protocol (MCP) サーバーを提供する Laravel パッケージです。