microsoft/bioemu
アミノ酸配列からタンパク質モノマー構造の平衡分布をサンプリングする生成モデルで、物理的妥当性を保証するためのステアリングシステムを備えています。
OpenSenseNova/SenseNova-Vision
SenseNova-Vision は、多様なコンピュータビジョンタスクを生成問題として扱う統合マルチモーダルモデルであり、単一のモデルでテキストと画像の出力を通じて検出、セグメンテーション、および幾何学的予測を実行できます。
dc-ai-projects/DC-Gen
拡散モデルのための高速化フレームワーク。事前学習済みモデルを高度に圧縮された潜在空間へ転送することで、品質を損なうことなく最大53.8倍の推論高速化を実現します。
LYiHub/pub-local-jarvis
Windows 向けのローカルでマルチモーダルなデスクトップアシスタント。画面とシステム音声を認識し、リアルタイムのゲームコンパニオン、授業ノート、文脈に応じたAIインタラクションを提供。
IamCreateAI/NeoVerse
NeoVerseは、単眼ビデオ映像から3Dシーンを再構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成 NeoVerseは、単眼ビデオ映像から3thoughtful_thought: 32 tokens.```json}{
Wakals/CoVT
CoVTは、視覚言語モデルが連続的視覚トークンを使用して推論できるフレームワークであり、意味的な思考を知覚的手がかりに根ざさせることで、空間的推論力と幾何認識能力を向上させます。
Visionary-Laboratory/holi-spatial
ビデオストリームを、3D Gaussian Splattingのジオメトリや空間QAペアを含む、アノテーション済みの3D空間インテリジェンスデータセットに変換するデータキュレーションパイプライン。
Alibaba-NLP/VRAG
テキスト、画像、動画を横断して VLM が推論・情報取得できるように、エージェント強化学習を用いたマルチターンマルチモーダル RAG フレームワークです。
PiSugar/whisplay-ai-chatbot
Raspberry Pi上で構築されたポケットサイズのAIチャットボットで、音声対話、画像生成、ローカルAIアクセラレーションを実現します。
bakrianoo/mazinger
音声認識、翻訳、音声クローン、オーディオアセンブリを1つのワークフローに統合するエンドツーエンドの動画ダブリングパイプライン。
facebookresearch/seamless_communication
100近い言語にわたって、音声とテキストの両方のモダリティをサポートし、高品質で表現力豊かなリアルタイム翻訳を実現するマルチモーダルAIモデルのファミリー。
octimot/StoryToolkitAI
ビデオ素材を文字起こし、インデックス化、検索するAI搭載の映画編集アシスタント。エディターはLLMを使用して、編集ソフトへの書き出し用にストーリーのセレクションを自動作成できます。
MMMU-Benchmark/MMMU
30の異なる科目にわたる大学レベルの専門知識と複雑な推論を用いて、マルチモーダルAIモデルを評価するための大規模な多分野ベンチマーク。
GPTomics/bioSkills
bioSkills は、配列I/Oからシングルセル、バリアントコール、構造生物学、ケモインフォマティクス、ワークフロー管理まで、生物情報学解析を実行するための準備済みコードテンプレート(「スキル」)のライブラリです。Claude Code、Codex、Gemini/Antigravity、OpenCode、OpenClaw に対応する軽量スクリプトでインストール可能で、ベストプラクティスのコマンドラインフラグ、例題スクリプト、使用ガイドを提供し、AI生成生物情報学コードの正確性を向上させます。
Jane-xiaoer/paper-collage-ad-codex
OpenAI Codex用の包括的なワークフロー・スキルで、クリエイティブな脚本から最終的なMP4レンダリングまで、ペーパーカラージュスタイルの広告を自動生成します。
xeronsh/openOii
LangGraph を使用して、ストーリーのアイデアから最終的なAI生成漫画動画までをオーケストレーションするマルチエージェントパイプラインを実現するAI漫画動画生成プロジェクト。
shang-zhu/violin
ネイティブのようなAI音声を使用して、動画を文字起こし、翻訳、および33言語に吹き替えるオープンソースの動画翻訳ツール。
livekit-examples/python-agents-examples
LiveKit Agentsフレームワークを使用して音声、ビデオ、電話AIエージェントを構築するための実行可能なPython例とフルスタックアプリケーションのコレクションです。
Voine/ChatWaifu_Mobile
ChatGPT、ローカルの VITS 音声合成、および Live2D アニメーションを統合し、没入感のあるキャラクターベースのAIコンパニオンを作成する Android アプリケーション。
microsoft/psi
Situated Intelligence のプラットフォーム (\psi) は、Microsoftがオープンソースで提供する .NET フレームワークであり、ロボット、ミックスドリアリティアシスタント、スマートスペースシステムなど、リアルタイムのマルチモーダルAIアプリケーションを構築するための高パフォーマンスなストリーミングインフラ、可視化ツール(PsiStudio)、センサー/AIコンポーネントのライブラリを提供する。WindowsおよびLinuxで動作し、MITライセンスのNuGetパッケージとして配布され、チュートリアル、サンプル、活発なコミュニティを備えている。
ChaitanyaEswarRajeshJakki/gemini-youtube-automation
Gemini 2.5 Flash を使用し、人手を介さずに毎日教育系 YouTube 動画と Shorts を作成・生成・アップロードする自律 AI ボット。
hassancs91/claude-youtube-editor
AI生成のビジュアル、音声クリーニング、自動アップロードにより、生のトークヘッド録画を洗練された動画に変換し、YouTube動画編集を自動化するオープンソースのパイプラインです。
suki0dayo/AI_film_studio
LLMによるプロンプト生成とComfyUIによる画像・動画生成間のワークフローを自動化することで、AI映画制作を合理化するノードベースのビジュアルエディタ。
Anionex/dsh-vision-toolkit
DeepSeek Harness用のビジョンツールキット。テキストのみのモデルに対し、UI復元、ロングスクリーンショットのOCR、GUI自動化などのタスクのための視覚的機能を提供します。
NVIDIAGameWorks/kaolin
NVIDIAが提供するPyTorchライブラリで、3Dディープラーニング向けのGPU最適化モジュールを提供しており、微分可能レンダリング、物理シミュレーション、3Dガウシアンスプラットのサポートを含む。
ParisNeo/lollms-webui
テキスト、画像、動画、音楽生成に適した数百のLLMおよびマルチモーダルAIモデルにアクセスできる統合型ローカルWebインターフェース。
GoogleCloudPlatform/vertex-ai-creative-studio
画像、動画、音楽、音声の生成およびクリエイティブワークフローを統合したインターフェースを提供する、Google Cloudのジェネレーティブメディアモデルを探索するためのWebアプリケーション。
Stonesjtu/pytorch_memlab
pytorch_memlab は、PyTorchコードの各行ごとのCUDAメモリ使用量をプロファイリングし、ライブテンソルを一覧表示し、一時的にGPUデータをCPUに移動できるPythonライブラリです。IPython/Jupyterとの統合により、PyTorchモデルでのメモリ不足エラーのデバッグを支援します。
pnnx/pnnx
pnnxは、PyTorchモデルを最適化し、軽量で依存関係のない形式(PNNX)およびncnn/ONNX-zeroファイルにエクスポートできるオープンソースツールで、エッジデバイスでの高速推論を可能にします。
ljquan/opentu
Opentuは、継続的なAIタスク実行のために、マルチモデル生成とツール管理を1つのワークスペースに統合するキャンバスベースのAIアプリケーションプラットフォームです。
OpenSQZ/MiniCPM-V-CookBook
MiniCPMシリーズのマルチモーダルモデル(テキスト、視覚、音声対応)のデプロイおよびファインチューニングの包括的なレシピブック。さまざまなハードウェアでの実行をサポート。
Cjbuilds/Codex-Orchestration
Codex Orchestrationは、Codexプラグインで、他のLLM(Claude Fable 5、Opus 5、OpenRouterモデルなど)をタスクに接続し、それぞれに特定の役割(プランナー、アドバイザー、デザイナー、エグゼキューター)を割り当てられます。Codexはトップレベルのオーケストレーターのまま、計画の反復、レビュー、必要に応じてUXアートファクトの設計、最終的なコード実行を行います。プラグインはCodexマーケットプレイスからインストールされ、Codexチャット内でスキルプロンプトで設定され、役割ごとの作業レベルをサポートします。計画の品質向上、並列作業の可能化、プレミアムモデル使用量の削減を目的としています。MITライセンス。
dromara/wgai
WGAI は、Spring-Boot + Vue で構築されたウェブプラットフォームで、ビジョン(OpenCV、YOLO、OCR、顔認識)、オーディオ(音声認識、ChatGPT風の対話)、デジタル人間アバター、AGVナビゲーションをオフライン優先、産業用レベルのAI管理システムとして統合しています。オンラインデータアノテーション、モデル学習、リアルタイム動画/音声分析、システム監視を提供し、設定用UIとパブリックデモインスタンスも備えています。コードは AGPL-3.0、サポートは主に有料の中国語コミュニティを通じて提供されています。
visualbruno/ComfyUI-Hunyuan3d-2-1
Tencentの Hunyuan3D-2.1 モデルのための ComfyUI ラッパーである、視覚的なノードベースのワークフロー内でテクスチャ付き 3D モデルを生成できるツールです。
zai-org/GLM-V
視覚言語モデル(VLM)のシリーズで、マルチモーダル推論を強化し、ネイティブな関数呼び出し、視覚的接地、複雑なドキュメント理解をサポートしています。
PaddlePaddle/ERNIE
テキストと視覚言語理解において最先端の性能を提供する、大規模マルチモーダルMoEモデルおよび開発ツールキットのファミリー。
cambrian-mllm/cambrian-s
空間推論と動画理解における「空間超感知」を強化するために設計された、マルチモーダルLLMとデータセットのスイートです。
qualcomm/aimet
AIMETは、PyTorch/ONNXモデルを量子化および圧縮するためのQualcommのオープンソースツールキットであり、精度低下を最小限に抑えつつ、エッジデバイス上で高速かつ低メモリな推論を可能にします。
SamurAIGPT/AI-Influencer-Generator
Stable Diffusion、gTTS、SadTalker を使用して、ソーシャルメディア向けに一貫性のあるバーチャル AI インフルエンサーを作成およびアニメーション化するオープンソースのパイプライン。
volcengine/rtc-aigc-demo
リアルタイム音声ベースのAI対話に向けた、RTC、ASR、LLM、TTSを統合したインタラクティブAIGCパイプラインを紹介するデモプロジェクト。
ShayneP/local-voice-ai
音声認識、LLM、音声生成モデルを用いたローカルで動作するプライベートで低レイテンシな音声アシスタント。
sympozium-ai/sympozium
Sympoziumは、マルチエージェントAIシステムを調整するオープンソースのKubernetesネイティブプラットフォームです。CRDベースのポリシー、共有SQLiteメモリ、サイドカー分離スキル、ビジュアルワークフローキャンバスを提供し、ガバナンスと可観測性を組み込みながら、チームがエージェントを大規模にオーケストレーションできるようにします。
nv-tlabs/Gamma-World
Gamma-Worldは、複数の独立して制御可能なエージェントが共有環境で同時に相互作用する生成型マルチエージェントワールドモデルであり、24 FPSでリアルタイムインタラクティブビデオ生成をサポートします。
kandinskylab/kandinsky-5
テキストまたは画像から高品質な動画と画像を生成する拡散モデルファミリーで、Pro と Lite バージョンがあり、英語とロシア語のサポートが充実しています。
OliBomby/Mapperatorinator
音声スペクトログラムから完全機能の osu! ビートマップを生成し、マッピングの不整合を検出する AI 駆動のモッディングツールを提供するマルチモデル AI フレームワーク。
IBM/terramind
地球観測向けの任意の入出力生成基盤モデルで、マルチモーダル空間データの生成と環境モニタリングを可能にします。
AvaLovelace1/BrickGPT
BrickGPTは、Llama-3.2モデルを微調整することで、テキストプロンプトから物理的に安定し、組み立て可能な玩具用ブロックモデルを生成するAIシステムです。
johnson7788/MultiUserClaw
MultiUserClaw は Docker を基盤とした SaaS フレームワークで、多数のユーザー向けに隔離された AI アシスタント(Hermesエージェント)を実行できます。React フロントエンド、認証・コンテナ管理・LLMプロキシ用の FastAPI ゲートウェイ、ユーザーごとの Hermes コンテナ、PostgreSQL ストレージ、知識ベース、スキルストア、cronジョブ、マルチチャネルボット、マルチモデル対応などの機能を備えています。