lucidrains/transfusion-pytorch
テキストの次トークン予測と、画像などの連続的モダリティのフローマッチングを1つのモデルで統合する PyTorch 実装。
landing-ai/ade-python
LandingAI ADE API用のPythonライブラリ。PDFおよび画像を構造化されたMarkdownに変換し、Pydanticモデルを使用して型付きデータを抽出する。
NEKOparapa/ReaDreamAI
テキスト生成、一貫したキャラクターイラスト、動画アダプテーションを自動化するAI駆動のプラットフォーム。
OpenEnvision/WorldFoundry
動画生成、3D/4D表現、および身体的AIにおいて、推論、アセットステージング、ベンチマーク評価を統合的に提供するオープンソースのインフラストラクチャ。
alexiglad/EBT
テキスト、画像、動画の各モダリティでスケーラブルな推論と System 2 思考を可能にする、エネルギーベーストランスフォーマー(EBT)用フレームワークです。
potamides/DeTikZify
DeTi*k*Zify は、スケッチやラスター科学図を編集可能な TikZ コードに変換するオープンソースのマルチモーダル LLM です。画像から TikZ への生成、Ti*k*Zero アダプタによるテキストから TikZ への生成、モンテカルロ木探索による反復的改善をサポートしています。pip でインストールでき、完全な TeX Live、Ghostscript、Poppler のインストールが必要で、GPU(8‑b モデル)または CPU(1‑b)で実行できます。リポジトリには、CLI/Web UI、Python API の例、Hugging Face 上のモデル重み、トレーニングデータセットを再作成するスクリプトが含まれています。
apple-aiml-research/ml-hierarchical-confusion-matrix
Neo はオープンソースの JavaScript ライブラリ(npm パッケージ `@apple/hierarchical-confusion-matrix`)で、階層的およびマルチアウトプットのクラスラベルに対応するインタラクティブな混同行列可視化を提供します。npm でインストールし、仕様と `{actual, observed, count}` レコードの配列を渡すだけで、任意のウェブページにマトリクスを埋め込めます。平坦、階層的(`:`)、マルチアウトプット(`,`)、および組み合わせラベル構造をサポートし、ライブデモ、ユニットテスト、完全な TypeScript ソースツリーを備えています。
lxtGH/OMG-Seg
画像、ビデオ、およびピクセルレベルのセグメンテーションを単一のモデルに統合し、専門家モデルの必要性を減らす、視覚的知覚と推論のための統合フレームワーク。
baxtree/subaligner
Subaligner は、字幕と動画/音声を同期するオープンソースの Python/CLI ツールです。Whisper を用いた音声認識、HuggingFace モデルによる字幕翻訳、カスタム同期モデルの訓練も可能。多数の字幕およびメディアフォーマットをサポートし、高速なグローバルシフト(`single`)と高精度の二段階(`dual`)同期を提供。Docker、pip、およびLLMベースの機能用オプション拡張も利用可能。
Softlandia-Ltd/vision-is-all-you-need
VLMを用いてPDFページを画像として埋め込むことで、ドキュメント検索時のテキストチャンク化の必要性を排除するビジュアルRAG(V-RAG)デモ。
openaiotlab/CUHK-X
人間の行動認識と推論のための大規模マルチモーダルデータセットとベンチマーク。7つの同期されたセンサモダリティを統合し、複雑な行動理解を可能にする。
EleutherAI/gpt-neox
GPT‑NeoX は、マルチ GPU クラスタ上で数十億パラメータの言語モデルをトレーニングするための、Megatron ベースのオープンソースライブラリです。DeepSpeed スタイルの最適化を追加し、多くのランチャー(Slurm、MPI など)をサポートし、NVIDIA および AMD GPU で動作し、Flash Attention、Mixture‑of‑Experts、選好学習ファインチューニングなどの最新機能を備えています。大規模な計算予算を持つ研究ラボに最適です。推論専用の使用には、Hugging Face `transformers` が推奨されます。
mbzuai-oryx/Video-ChatGPT
LLMと時空間視覚エンコーダーを組み合わせた動画会話モデルで、動画コンテンツについて詳細で自然な言語での議論を可能にします。
mbzuai-oryx/groundingLMM
GLaMM は、自然言語応答とオブジェクトセグメンテーションマスクを統合し、正確な視覚的グラウンディングを実現するピクセルグラウンディング大規模マルチモーダルモデルです。
mbzuai-oryx/LLaVA-pp
LLaVA++ は、LLaMA-3 と Phi-3 LLM を統合することで、LLaVA 1.5 の視覚的指示に従う能力と学術的タスクのパフォーマンスを向上させます。
NVlabs/OmniVinci
OmniVinciは、視覚、音声、テキストを統合的に理解するため、専用の時間的・整列(alignment)アーキテクチャを使用し、クロスモーダル推論を向上させるオープンソースの全モーダルLLMです。
blendi-remade/falcraft
テキストプロンプトから、fal.ai を使って 3D 構造物とゲーム内世界でリアルタイムに AI 動画配信を生成する Minecraft Fabric モッド。
TetreesEX/TetreesAgent_EX
Tetrees Agent EX は、公開 MCP コントラクトを介して Tetrees EX マーケットプレイス上の AI パックを検索、見積もり、実行、拡張、公開できる Node.js SDK/CLI です。購入者、構築者、販売者のフロー用の例題スクリプトを提供し、すべての資格情報をローカルに保持します。
JavisVerse/JavisDiT
テキストプロンプトから音声と映像の意味的・時間的整合を保証する、音声付き動画生成のための統合型 Diffusion Transformer フレームワーク。
caiyuanhao1998/Open-DiffusionGS
ガウススプラッティングを拡散ノイズ除去器に統合した単一段階の画像から3D生成・再構築フレームワーク。高速でスケーラブルな3D作成を実現。
open-gigaai/giga-models
GigaModelsは、数十種類の事前学習済みの視覚・拡散・マルチモーダルモデル(例:Grounding DINO、Depth Anything、GigaBrain‑0、Pi0、Cosmos‑Predict2.5)を統一された `load_pipeline` API の背後でラップするオープンソースのPythonツールボックスです。推論と学習の両方をサポートし、即座に実行可能なスクリプトを提供し、conda + pipでインストール可能です。
huggingface/huggingface-gemma-recipes
Gemmaファミリーのモデルを使ってマルチモーダル推論、ファインチューニング、RAGを実装するための最小限のレシピとノートブックのコレクションです。
microsoft/XPretrain
XPretrain は、Microsoft Research のリポジトリであり、video-text および image-text ペアを用いた大規模なマルチモーダル事前学習のための、コード、事前学習済みチェックポイント、および HD-VILA-100M video-language データセットを提供します。HD-VILA、LF-VILA、CLIP-ViP、Pixel-BERT、SOHO、および VisualParsing などのモデルが含まれており、それぞれが最近のカンファレンス論文に紐付けられています。
OliverDOU776/Few-step-probabilistic-glucose-forecasting-from-continuous-glucose-monitoring-and-meal-images
大規模なソースデータセットから小規模なターゲットデータセットへ知識を転送する条件付きリクティファイドフローを用いた、高速な確率的予測ツール。
wit-ai/pywit
Wit.ai 用の Python SDK で、開発者がアプリケーションにテキストおよび音声の自然言語理解を簡単に統合できるようにします。
6551Team/opentwitter-mcp
opentwitter‑mcp は、準備済みのツールとWebSocketプッシュAPIを介して、AIアシスタントがTwitter/Xのプロフィール、ツイート、検索、リアルタイムフォロワーイベントを取得できるPython MCPサーバーです。
wladradchenko/wunjo.wladradchenko.ru
プライバシー保護のためローカル環境で動作する、フェイススワップ、音声クローニング、動画生成のためのオールインワンAIメディアツール
erdogant/pca
scikit‑learnのPCA/SparsePCA/TruncatedSVDをラップし、バイプロット、説明分散チャート、外れ値検出(Hotelling T²、SPE/D‑ModX)、特徴量重要度の抽出、モデルの保存/読み込み、分散の正規化、新しいデータの投影といった機能を備えた、主成分分析(PCA)を簡素化するPythonライブラリ。
MemeMeow-Studio/MemeMeow
埋め込みモデルと視覚AIを活用して、感情やシーンの説明に基づいてミームを検索する自然言語検索ツール。
tensorflow/model-analysis
TensorFlow Model Analysis (TFMA) は、大規模かつスライス対応の TensorFlow モデル評価用ライブラリです。分散 Beam パイプラインを実行し、Jupyter で結果を可視化し、TFX/Kubeflow パイプラインと統合できます。
tensorflow/data-validation
TensorFlow Data Validation (TFDV) は、機械学習データセットの統計計算、スキーマ推論、異常検出を行うスケーラブルなPythonライブラリです。TensorFlow/TFXパイプラインと統合され、Apache Beamによる分散処理を活用し、データ品質を検査するための視覚的UIツールを提供します。
polyaxon/haupt
Hauptは、実行の出自情報、アーティファクト/メトリクスのストリーミング、インタラクティブなサンドボックスセッション(SSH/tmux)、ローカルビューアAPI、ホストされたノートブックスペースを提供するPolyaxonのサービスです。これらのツールは、機械学習実験の管理、監視、再現を支援します。
tonywu71/colpali-cookbooks
ColPaliおよびColQwen2モデルを用いた視覚ベースのドキュメント検索の実装、ファインチューニング、解釈のためのノートブックのコレクション。
vincentarelbundock/marginaleffects
`marginaleffects` は、100以上の統計および機械学習モデルタイプから予測、対比、限界効果、仮説検定結果を簡易に抽出できる、R/Python用のライブラリであり、無料の補足書付きです。
eeeXun/gtt
gtt はGoで作られたターミナルUIで、Google、DeepL、Bing、Apertium、LibreTranslate、Reverso、ChatGPTなど、多数のオンライン翻訳サービスを使ってテキストを翻訳できます。APIキーの設定、カスタムキーバインド、カラーテーマ、クリップボード連携、テキスト読み上げをサポートしており、バイナリ、パッケージマネージャ、Docker、またはソースからのビルドでインストール可能です。
deeplearning4j/deeplearning4j-examples
Eclipse Deeplearning4J エコシステム(DL4J、ND4J、SameDiff、DataVec、RL4J など)の使い方を、基本的なニューラルネットワーク学習から Spark 分散学習や GPU 加速学習、モデルインポート、Android デプロイまで、Maven ベースの Java 例プロジェクトで示す。
wandb/examples
人気のある機械学習フレームワーク(PyTorch、TensorFlow/Keras、Hugging Face、XGBoost、scikit‑learn など)に、Weights & Biases の追跡ライブラリを組み込む方法を示す、即実行可能なスクリプトと Colab ノートブックの選別済みセットです。実行ログ、設定、メトリクス、勾配、アーティファクトの記録を実演し、数行のコードでモデルの実験追跡と再現性を実現する手助けをします。
ai-ng/2txt
Next.js と Vercel AI SDK を使用し、GPT-5-nano モデルを活用して構築された高速な画像からテキストへの変換ツール。
leamsigc/ShortsGenerator
AIスクリプト生成、ストック映像調達、TTSボイスオーバー、ソーシャルメディアスケジューリングを処理する自動化パイプライン。
win4r/openclaw-a2a-gateway
OpenClaw A2A Gateway – Node.jsプラグインで、GoogleのAgent-to-Agent v0.3.0プロトコルを実装。ゼロコンフィグインストール、自動ピア発見(DNS-SD/mDNS)、マルチトランスポートフェールバック(JSON-RPC、REST、gRPC)、バイオインスパイアドルーティング、サーキットブレーカーレジリエンス、ベアラートークン認証、ファイル転送ツールキットを提供。
duolahypercho/fusion-fable
Fusion‑Fable は Claude Code スキルであり、Opus 4.8、GPT‑5.5、Gemini 3.1 Pro の複数のLLMを並列で実行し、Opus 4.8 が独立した回答を審査して構造化された最終回答を合成します。スラッシュコマンドでインストールされ、証明書ファイルを保存し、OMC計画システムと連携する反復的計画モード(`/fusion‑plan`)を備えています。ゼロセットアップパネル(2回のOpus 4.8実行)は即時利用可能。より豊富なパネルには `codex` と `agy` CLI が必要。トレードオフはトークンコストとレイテンシの増加ですが、結果として高品質で監査可能な回答が得られます。
nikkigallery/Whimbox
LLMと画像認識を活用し、画面キャプチャと入力シミュレーションによって、ゲーム『Infinity Nikki』における日常タスク、ナビゲーション、アクティビティの自動化を実現するAIエージェント。
commaai/commavq
VQ-VAEによる動画圧縮と、GPTベースのモデルによる将来の走行シーン予測を活用した自律走行用の世界モデルフレームワークとデータセット。
kyegomez/MultiModalMamba
Vision Transformer (ViT) と Mamba を統合したマルチモーダルAIモデルで、テキスト、画像、音声、動画データを同時に効率的に処理・解釈します。
ashnkumar/sketch-code
画像キャプションアーキテクチャを用いて、手書きのウェブモックアップをHTMLコードに変換するディープラーニングモデル。
mlcommons/training
MLPerf Training ベンチマークスイートのリファレンス(最適化されていない)実装を収録したリポジトリ。ビジョン、言語、推薦、グラフモデルをカバー。各ベンチマークにはモデルコード、Dockerfile、データセットスクリプト、目標品質に達するまでの所要時間を測定するトレーニング実行スクリプトが含まれます。ベンチマーク提出、ハードウェア評価、学習目的に適していますが、実世界のパフォーマンス用途には向いていません。
luciddreamer-cvlab/LucidDreamer
LucidDreamer は、単一の画像とテキストプロンプトからドメインフリーで 3D ガウシアンスプラッティングシーンを生成するシステムです。
HITsz-TMG/Uni-MoE
Uni-MoEは、テキスト、画像、音声など複数のモダリティ間で理解・生成が可能なMixture-of-Expertsベースのオムニモーダル大規模モデルです。