fudan-generative-vision/Hallo-Live

Hallo-Live は、因果的なデュアルストリーム Diffusion Transformer を使用して、デジタルアバター向けに同期した音声と映像をリアルタイムに生成するテキスト駆動フレームワークです。

Lightning-AI/litData

LitDataは、S3/GCS/Azure/HF Hubなどから直接非同期バッチダウンロードで生ファイルをストリーミングするか、一度だけデータセットをLitData独自のチャンク化バイナリ形式に変換することで、PyTorchトレーニングを最大20倍高速化するLightning AIのライブラリです。`StreamingRawDataset` はクラウドストレージから直接データをストリーミングし、`ld.optimize` はデータを最適化して再開可能でシャッフル対応の高速ストリーミングを可能にします。また、画像リサイズや埋め込み生成などの並列前処理を `ld.map` で実行でき、PyTorch Lightning、Hugging Face datasets、Lightning Cloudとの統合も完備。I/Oがボトルネックとなる大規模MLプロジェクトに最適です。

ZebangCheng/Emotion-LLaMA

Emotion-LLaMAは、音声、視覚、テキスト入力を専用エンコーダーとインストラクションチューニングで統合することで、感情認識と推論を目的としたマルチモーダル大規模言語モデルです。

RTGS2017/NagaAgent

NagaAgentは、Windows/macOS/Linux対応のクロスプラットフォームデスクトップAIアシスタントです。OpenAI互換LLMとのチャット、JSONブロックによるカスタムツール呼び出し、Neo4jに保存されたグラフRAGメモリ、Live2Dアニメーションアバター、リップシンク付き音声合成/認識、天気・Web検索・ゲームガイドなどに対応するプラグインMCPフレームワーク、およびフォーラムやスキルマーケットといったコミュニティ機能を備えています。Electron/Vueフロントエンド+Python FastAPIバックエンドで構成され、`uv sync`(またはpip)でインストール可能。AGPL-3.0+独自商用ライセンスの二重ライセンスです。

microsoft/foldingdiff

計算タンパク質設計に使用できる新しいタンパク質折りたたみ構造を生成するための拡散モデル。

HKU-BAL/Clair3

Clair3 は、長読取りシーケンシング向けのオープンソースの深層学習型変異呼び出しツールです。まず Pileup ベースのニューラルネットで高速スキャンを行い、その後不確実な部位を Full‑alignment モデルで精査することで、精度を高めつつ実行時間を合理的に保っています。CPU、GPU、Apple‑Silicon ビルドに対応し、Docker、Singularity、Bioconda、Conda 環境でインストール可能で、ONT、PacBio HiFi、Illumina データ用の事前学習済み PyTorch モデルを同梱しています。

tin2tin/Pallaidium

Blender Video Editorに統合された生成AI映画スタジオで、AI生成された動画、音声、テキストを使って、フルフィルム制作をプロトタイピングできる。

Sharrnah/whispering

ストリーミングオーバーレイやゲーム内利用向けに設計された、リアルタイム音声認識・翻訳およびOCRを実行するローカルでオープンソースのツール。

jtydhr88/ComfyUI-HY-Motion1

HY-Motion 1.0に基づくテキストから3D人間の動きを生成するComfyUIプラグイン。プロンプト最適化とGLB・FBXへのエクスポートを備える。

InternRobotics/PointLLM

PointLLMは、物体分類やキャプション生成などのタスクにおいて、色付き3Dポイントクラウドを理解できるマルチモーダル大規模言語モデルである。

OpenBMB/VisRAG

テキスト解析による情報損失を防ぐためにドキュメントを画像として埋め込み、多画像QAに証拠に基づく推論を用いる視覚言語RAGパイプライン。

zju3dv/Diffuman4D

Diffuman4Dは、疎な視点からのビデオから自由視点レンダリングを可能にする、高忠実度で4D一貫性のある人間視点合成のための時空拡散モデルです。

apple-aiml-research/ml-neuman

NeuManは、単一の動画からアニメーション可能な人間とその背景シーンを再構成するニューラルレンダリングフィールドの実装であり、オリジナル環境内の新しい視点やポーズの合成を可能にします。

uezo/ChatdollKit

Unity 向けの 3D バーチャルアシスタント SDK で、3D VRM モデルを音声対応のチャットボットに変換し、同期された発話、リップシンク、自律的なアニメーションを実現します。

apple-aiml-research/ml-lito

LiToは、オブジェクトの形状と視点依存の外観を共同でモデル化する3D潜在表現システムであり、リアルな照明効果を備えた高品質な画像から3Dへの生成を可能にします。

monatis/clip.cpp

メモリ制約のあるデバイスやサーバーレスデプロイメント向けに効率的な推論を実現する、依存関係のない C/C++ 実装の CLIP。

android/androidify

Gemini API、Imagen、Jetpack Compose を使用して AI ベースの体験を構築するオープンソースの Android サンプルアプリ。Android ボットメーカーを再構築する。

Voine/ChatWaifu_Mobile

ChatGPT、ローカルの VITS 音声合成、および Live2D アニメーションを統合し、没入感のあるキャラクターベースのAIコンパニオンを作成する Android アプリケーション。

kyegomez/Gemini

テキスト、画像、音声を1つのアーキテクチャ内でネイティブに処理できるオープンソースのマルチモーダルトランスフォーマーモデルの実装。

PozzettiAndrea/ComfyUI-UniRig

UniRigとMake it Animatable (MIA) を使用して、ComfyUIで3Dキャラクターメッシュのリギングとスキンニングを自動化する拡張機能です。

theopenconversationkit/tock

Tock は、NLPスタック、対話フローを設計するためのビジュアルスタジオ、KotlinベースのDSL(Python、Node.js、RESTバインディング付き)、チャット/音声チャネルへの事前構成済みコネクタ、Dockerベースのデプロイを提供するオープンソースの会話型AIプラットフォームです。

Angel-ML/angel

Angelは、パラメータサーバーアーキテクチャを採用したJava/Scalaベースの分散型機械学習およびグラフ計算プラットフォームです。多くの古典的MLアルゴリズム(LR、SVM、GBDT、LDA*など)とグラフアルゴリズム(PageRank、GCN、GraphSAGEなど)をサポートし、YARNまたはローカルで実行可能で、Spark統合(Spark on Angel)によりジョブの送信が容易になります。

facebookresearch/multimodal

CLIPやBLIP-2などのモデル向けに、モジュール式の構成要素と学習済み重みを提供し、最先端のマルチモーダルモデルを大規模にトレーニングするためのPyTorchライブラリ。

mattmireles/gemma-tuner-multimodal

Gemma‑tuner‑multimodal は macOS 専用の Python パッケージで、Google の Gemma モデル(3n および 4 シリーズ)を LoRA でテキスト、画像、音声データに対して微調整可能。Apple Silicon(MPS)でネイティブ実行、GCS/BigQuery からの大規模データストリーミング、ウィザード形式 CLI、リアルタイム Web ビジュアライザーを備え、Core ML や GGUF 推論用にマージされたチェックポイントをエクスポート可能。

flutter-ml/google_ml_kit_flutter

モバイルアプリがデバイス上でビジョン、自然言語、生成AI機能を実行できるようにする、Flutterプラグインのセット。

aws-samples/sample-mobile-ai-assistant

Android、iOS、macOS向けのクロスプラットフォームAIアシスタントアプリ。リアルタイムチャット、マルチモーダル分析、さまざまなLLMプロバイダーを活用した即時Webアプリ作成を可能にします。

Osilly/Vision-DeepResearch

画像と動画を横断した反復的な視覚的およびテキスト検索を通じて、深層研究を実行できるマルチモーダル大規模言語モデル(MLLM)の開発を可能にするフレームワークとベンチマーク。

PozzettiAndrea/ComfyUI-TRELLIS2

MicrosoftのTRELLIS.2モデルを実装したカスタムComfyUIノード。1枚の画像からPBRマテリアルを備えた高品質な3Dメッシュを生成する。

wuxiran/cc-pane

CC‑Panesは、Windows/macOS/Linux向けのオープンソースデスクトップアプリで、複数のAIコーディングCLIエージェントを並行して実行、整理、調整できます。ワークスペースレベルのダッシュボード、再利用可能な起動プロファイル、MCPベースのオーケストレーションレイヤー、統合ターミナル分割、Git/履歴ツール、計画サーフェス、Web/Androidアクセスを提供します。すべてTauri、xterm.js、Rustで構築されています。

deepmodeling/dpgen

DP‑GENは、深層学習原子間ポテンシャル(Deep Potentialモデル)の作成を自動化するPythonプラットフォームです。構造のサンプリング、DFT計算に最も情報量の多い構造の選択、モデルの再トレーニングという並行学習ループを実行し、HPCクラスターでのジョブスケジューリングを処理し、多くのMDおよび量子化学コードとインターフェースします。

vinavfx/ComfyUI-for-Nuke

ComfyUI ノードを Nuke に統合する API で、VFX アーティストがプロフェッショナルな合成ソフトウェア内で直接生成AIワークフローを使用できるようにします。

PEPETII/danmuai

ビジョンモデルを使用して画面コンテンツをリアルタイムで分析し、オプションの音声合成を備えたスクロールAIコメント(弾幕)を生成するWindowsデスクトップアシスタント。

kkirchheim/pytorch-ood

pytorch‑ood は PyTorch 上で構築された本格的な Python ライブラリで、分布外検出を実現します。30 以上の検出器、損失関数、事前学習済みモデル、データセット、ユーティリティを統合し、pytorch‑lightning と連携可能で、シンプルな API とベンチマークヘルパーを提供します。`pip install pytorch-ood` でインストールし、`EnergyBased` のような検出器を数行のコードで利用できます。

Utopai-Research/pai-pro

コードエージェントとビジュアルキャンバス、統合メディアAPIを組み合わせたローカルファーストのAI映画制作ワークスペース。

elder-plinius/GL4SS

2.52億年前から西暦3050年まで、地球上のあらゆる場所のあらゆる時点におけるAIビジュアルを生成する時空イメージ・ビデオエンジンです。

microsoft/Tutel

Tutel は、Microsoft が提供する大規模言語モデル用のオープンソース、高性能 MoE ライブラリです。ダイナミック・パラレルリズム、ダイナミック・インファレンス(NVFP4, MXFP4, FP8, BF16)、最大 1M トークンのコンテキスト、ビジョン拡張、NVIDIA と AMD GPU で DeepSeek-V3.2, Kimi-K3, GLM-5.x, Qwen-3, GPT-OSS などのモデルを動かす Docker イメージを提供します。pip で Git リポジトリからインストール、またはソースからビルド、その後、提供された Docker コンテナを利用するか、Python API を用いてカスタム MoE ルーティングを行います。

IDEA-CCNL/Fengshenbang-LM

中国語の事前学習済み基盤モデルのオープンソース・エコシステム、および自然言語理解、生成、マルチモーダル・タスクをサポートするフレームワーク。

open-ribbi/velocut

AI統合による自動シーン構成と編集を備えた、マルチトラックビデオ編集と3Dシーンディレクションを統合したブラウザベースのスタジオ。

yan5xu/codexloom

CodexLoomは、自己ホスト型プラットフォームであり、Codexチャットエージェントに耐久的なアイデンティティ、プロフィール、組織ツールを追加します。これにより、複数デバイスからアクセス可能で、バウンデッドメッセージで通信し、Feishu、Slack、Parallなどの外部チャットプラットフォームにインターフェースエージェントを通じて公開できる「ドメインエージェント」を実現します。高度な単独ユーザー向けに、UI、CLI、ガバナンス機能を提供し、Elastic License 2.0の下でリリースされています。

SkyworkAI/Skywork-R1V

Skywork-R1Vは、強化学習と視覚的思考の連鎖(Visual Chain-of-Thought)を用いて、複雑な視覚的論理、数学、物理のタスクにおいて最先端の性能を実現するオープンソースのマルチモーダル推論モデルです。

datawhalechina/torch-rechub

Torch-RecHubは、30以上のモデル、モジュール設計、ONNXエクスポート、複数のハードウェアバックエンドをサポートするPyTorchフレームワークです。

OpenImagingLab/AnyRecon

AnyReconは、動画拡散モデルを用いて、撮影ビューのセットから任意視点の高品質な3D再構成を生成する3D再構成フレームワークです。

jd-opensource/JoyAI-Image

画像理解、テキストから画像への生成、および指示に基づく画像編集を統合し、空間知能に焦点を当てた統一マルチモーダル基盤モデル。

Capsize-Games/airunner

プライベートでローカルファーストの AI コンパニオンとアート生成プラットフォーム。カスタマイズ可能なチャットパートナーとレイヤー型クリエイティブキャンバスを組み合わせます。

yuqie6/ProductFlow

AI駆動の視覚的ワークフローを用いて、コピーと画像生成を行うことで、小規模な販売者向けのオープンソースで自己ホスト可能なワークスペースです。

mintdotgg/mint-playground

Mintアセットパイプラインで構築された、インタラクティブな3Dショールーム、ゲーム、データ可視化を実現するオープンソースのThree.js体験のコレクションです。

openbezal/rhema

ライブ音声フィード内の聖書の箇所をリアルタイムでAIで検出し、NDI経由で放送用オーバーレイとしてレンダリングするデスクトップアプリ

lucidrains/transfusion-pytorch

テキストの次トークン予測と、画像などの連続的モダリティのフローマッチングを1つのモデルで統合する PyTorch 実装。