J3n5en/EnsoAI
EnsoAIは、Git worktree管理と永続的なAIエージェントセッション(Claude, Gemini, Codexなど)を組み合わせた、Electronベースのデスクトップワークベンチです。内蔵のMonaco editor、視覚的なGit UI、3方向マージツール、およびワンクリックでのIDEブリッジ機能を提供し、開発者が複数のブランチを並行して作業しながら、各ブランチに専用のLLMコンテキストを保持させることが可能です。
tensorflow/java
TensorFlow‑Java は、Maven に公開可能な Java/JVM バインディングを提供し、低レベル JNI ラッパー(`tensorflow‑core`)、高レベルニューラルネットワーク API(`tensorflow‑framework`)、および独立した ndarray ライブラリを含みます。Linux(x86_64、arm64)および macOS(Apple Silicon)のバイナリをサポートし、オプションで GPU ビルドも可能で、標準的な Java ビルドツールと統合されます。
mistralai/client-python
Mistral AIのクラウドAPI(チャット、埋め込み、音声、ファイル、エージェントなど)向けの公式Python SDK。`pip`/`uv`/`poetry`でインストールし、`MISTRAL_API_KEY`を設定後、`client.chat.complete(...)` を同期または `asyncio` で呼び出せます。AzureおよびGCPラッパー、ストリーミング、ページネーション、リトライなどもサポートしています。
nextcloud/recognize
ローカルAIモデルを使用して、写真、動画、音楽を自動的に分類するNextcloud向けスマートメディアタグ付けアプリ
inclusionAI/Ming
Ming-flash-omni 2.0 は、1つのMoEベースのアーキテクチャでテキスト、画像、音声、動画のマルチモーダル認識と生成を統合するオープンソースのオムニMLLMです。
cgnomads/GSOPs
SideFX Houdini用のプラグインで、VFX制作向けにガウシアンスプラッティングシーンのインポート、編集、アニメーションを可能にする包括的なツールセットを提供します。
sambanova/bloomchat
BLOOMChatは、オープンソースのBLOOMモデルからファインチューニングされた1760億パラメータの多言語対応チャットLLMです。リポジトリにはデータ準備、トークナイゼーション、およびSambaNovaのRDUハードウェア向けトレーニングスクリプトが含まれており、Hugging FaceのBloom推論コードを使用した詳細なGPU推論手順も提供されています。研究者や開発者がモデルを再現または実行したい場合に向けた本格的な大規模LLMプロジェクトです。
remyxai/VQASynth
視覚言語モデルの3D空間推論能力および距離推定能力を向上させるために、画像データセットを空間VQAデータセットに変換するパイプライン。
smartscanapp/smartscan-android
オンデバイス処理と自動メディアグループ化を使用して、画像と動画を検索可能な個人用知識ベースに変換する Android アプリ。
AIGeeksGroup/3D-R1
3D-R1は、合成CoTデータと強化学習を活用して空間推論とシーン理解を強化する汎用3Dビジョン言語モデルです。
kozistr/pytorch_optimizer
PyTorch互換性のあるライブラリであり、100以上の研究用オプティマイザ、複数の学習率スケジューラ、損失関数を単一の一貫したAPIを通じて提供し、低精度トレーニングのためのオプションの統合機能も備えています。
OmniCustom-project/OmniCustom
OmniCustomは、参照入力とテキストプロンプトに基づいて、特定の視覚的アイデンティティと声のトーンを保持する同期した動画を生成する統合音声・映像生成フレームワークです。
kyegomez/ScreenAI
ユーザーインターフェースとインフォグラフィックスを理解するように設計されたScreenAIビジョン・ランゲージモデルの実装。
Cerlancism/chatgpt-subtitle-translator
OpenAI ChatGPT API(または互換サービス)を使用して、SRT字幕ファイルを1行ずつ翻訳するNode.js CLI/Web UI。タイムスタンプを保持し、バッチ処理、構造化JSON出力、プロンプトキャッシュ、オプションのモデレーション、高度なマルチパス「エージェント」モードをサポートする。
HUANGLIZI/LViT
LViTは、言語と視覚の変換器を組み合わせたマルチモーダルフレームワークであり、CTスキャンやその他の医療画像における医療画像セグメンテーションの精度を向上させます。
MME-Benchmarks/Video-MME-v2
三段階の段階的な難易度スケールとグループ化された非線形スコアリングを用いて、MLLMにおける動画理解の真の時間的推論能力を評価する堅牢なベンチマークです。
software-mansion-labs/private-mind
クラウド依存なしに、プライベートかつオフラインで動作するモバイルAIアプリ。デバイス上でチャット、ドキュメント分析、マルチモーダル対応のインタラクションを実現。
VrchStudio/comfyui-web-viewer
ComfyUI用のカスタムノードコレクションで、MIDI、OSC、ゲームパッドなどのストリーミングおよび外部コントロールを統合し、リアルタイムのインタラクティブAIアートを可能にします。
ixaxaar/pytorch-dnc
PyTorchライブラリで、Differentiable Neural Computers (DNC)、Sparse DNC (SDNC)、Sparse Access Memory (SAM) を実装。インストール手順、APIの使い方、デバッグサポート、および例題トレーニングタスク(コピー、加算、argmax)を含む。
tianclll/Ace-Translate
プライバシーに焦点を当てたオフラインのドキュメント翻訳ツール。ローカル LLM と OCR を使用し、元のレイアウトを保持したまま多様なファイル形式を翻訳します。
PipeNetwork/kimi-k3-mlx
Apple Siliconで実行可能な、MoonshotのKimi-K3マルチモーダルMoEモデルのMLXポート。ストリーミングコンバーターとREAPプリューニングを備えています。
pipecat-ai/pipecat-client-web
Pipecatフレームワークで構築された音声およびマルチモーダルAIアプリケーションと接続・相互作用するためのWebクライアントSDKおよびReactライブラリ。
facebookresearch/mmf
MMFは、視覚と言語のマルチモーダル研究のためのモジュール式PyTorchベースのフレームワークであり、最先端モデルのリファレンス実装と分散トレーニング用のツールを提供します。
om-ai-lab/VLM-FO1
VLM-FO1は、汎用的な推論能力を損なうことなく、細粒度な知覚と空間認識を強化するVision-Language Model用のプラグアンドプレイ・モジュールです。
OpenEnvision/Awesome-Multimodal-Modeling
Awesome‑Multimodal‑Modeling は、マルチモーダルAIモデルを調査するコミュニティキュレート「awesome-list」です。4つの明確なファミリー(Traditional、MLLMs、Unified、Native)を定義し、アーキテクチャの違いを説明し、Hugging Face 上のオープンソースモデルコレクションへのリンクを提供します。急速に進化するマルチモーダル分野の構造的視点を必要とする研究者やエンジニア向けのリポジトリです。
Sharrnah/whispering-ui
Whispering TigerアプリケーションのネイティブWindows UI。オーディオストリームやゲーム内画像のリアルタイム文字起こしと翻訳を可能にします。
ardha27/AI-Waifu-Vtuber
音声認識、LLM、およびテキスト読み上げを統合し、ライブ配信や個人利用向けにインタラクティブなバーチャルキャラクターを作成するAI搭載VTuberアシスタント。
tongjingqi/Thinking-with-Video
ビデオ生成モデルが複雑な視覚的・テキスト的推論タスクを解決する能力を評価する、新しいマルチモーダル推論パラダイムおよびベンチマーク(VideoThinkBench)。
AceDataCloud/Nexior
NexiorはMITライセンスのVueベースのアプリで、40以上のチャット、画像、音声、動画AIモデルを1つの自己ホスティング可能なUIに集約しています。1クリックVercelまたはDockerデプロイ、BYOKまたは1つのAceDataキー、組み込みのユーザー認証、支払い、紹介メカニズムを備えており、AI製品用の即戦力SaaSスタートアップとして利用可能です。
awekrx/ChatGPT-MidJourney-prompt
簡単なテキストのヒントから、MidJourney画像用の詳細でクリエイティブなプロンプトを自動生成するPythonライブラリ。
HorizonWind2004/reconstruction-alignment
統一マルチモーダルモデルのための自己教師あり事後学習手法。モデルが自身の視覚的特徴から画像を再構成するように学習させることで、画像を生成・編集する能力を向上させます。
Licoy/GoAmzAI
個人および企業向けの、テキスト、画像、動画、音楽、PPT生成を統合管理システムに統合した、プライベートなマルチモーダルAIGCプラットフォームです。
a616567126/GPT-WEB-JAVA
ユーザー管理と決済システムを備えた商用AIサービスとして、GPT、Midjourney、Stable Diffusionを統合したJavaベースのWebプラットフォーム。
lone-cloud/gerbil
SUMMARY: 自分のハードウェア上でローカルなテキストおよび画像生成を実行するクロスプラットフォームデスクトップアプリケーションで、統合されたモデル検索とさまざまなGPUアクセラレータのサポートを特徴とします。
SkyworkAI/UniPic
画像編集、生成、理解のための統一マルチモーダルモデルシリーズ。高速マルチイメージ編集と自己回帰モデリングを特徴とする。
noahgsolomon/brainrot.js
Groq、OpenAI、Speechify を使用して、著名人の声クローンと生成コンテンツを組み合わせた AI 生成動画を自動作成するツール。
Fabric-Project/Fabric
macOS上で、インタラクティブな3Dグラフィックス、画像/動画処理、AI強化ビジュアルの迅速なプロトタイピングのためのビジュアルノードベースのクリエイティブコーディング環境。
askui/python-sdk
ビジョンベースの自動化を使用して、壊れやすい UI selector を使用せずに、AI agent がデスクトップやモバイルデバイスを制御可能にする Python SDK です。
IliasHad/edit-mind
ローカルの動画ナレッジベースで、文字起こしとビジュアル分析により動画をインデックス化し、自然言語で動画コンテンツを意味的に検索できるようにします。
nv-tlabs/XCube
XCubeは、階層的潜在拡散とVDBデータ構造を使用して、詳細な3Dオブジェクトと大規模なシーンを作成する、高解像度疎な3Dボクセルグリッド用の生成モデルです。
FoundationVision/Liquid
Liquid は、外部の視覚埋め込みを必要とせず、視覚理解と画像生成を単一の LLM に統合した統一的な自己回帰マルチモーダルジェネレータです。
WHU-USI3DV/VistaDream
VistaDream は、生成された新しいビュー間の一貫性を確保することで、単一ビュー画像から高品質な 3D シーンを再構築するトレーニング不要フレームワークです。
OpenDCAI/OpenWorldLib
高度な世界モデルのための統一されたコードベースとフレームワーク。ビデオ生成、3Dシーン生成、および視覚-動作推理のための様々なオープンソース研究を統合しています。
livekit/python-sdks
LiveKit Python SDK は、LiveKit ルームに参加し、ビデオ・オーディオトラックの公開/受信、RPC 呼び出し、ハードウェアコーデックの制御を行うための非同期クライアントツールを提供します。補完パッケージ `livekit-api` は、ルーム作成、トークン生成、SIP、エグレッシングなどの LiveKit サーバ REST エンドポイントをラップしており、LiveKit Agents と統合して STT、LLM、TTS モデルを組み合わせた音声AIボットを構築できます。
ChilloutCharles/BrainFlowsIntoVRChat
バイオセンサーからのEEGおよびバイオメトリクスデータをOSCパラメータに変換し、VRChatで脳制御アバターアニメーションやエフェクトを可能にするツール。
Nutlope/make-comics
Google Flash Image 2.5 と Qwen3 80B を使用して、物語、キャラクター、パネルをAIで生成する、AI駆動の漫画作成ツール。
vual/lobe-chat-pro
Lobe Chat Pro は、オープンソースでセルフホスト可能なAIチャットプラットフォーム(lobe‑chat のフォーク)であり、完全な管理者コンソール、ユーザー/グループ管理、複数ベンダーのモデル価格設定、支払い統合(WeChat、Stripeなど)、画像・音楽・動画生成用のマルチモーダル「無限キャンバス」パネルを追加しています。Dockerで3つの形態(フルバックオフィス、ログイン付きゲートウェイオンリー、ログインなしゲートウェイオンリー)でデプロイ可能です。
GitHpriyanshu23/Smart-Plant-Doctor
ESP32によるリアルタイム環境センシングと画像ベースの病気検出、Gemma 4搭載のケアアシスタントを組み合わせたAIとIoT植物健康プラットフォーム。