johnson7788/MultiUserClaw

MultiUserClaw は Docker を基盤とした SaaS フレームワークで、多数のユーザー向けに隔離された AI アシスタント(Hermesエージェント)を実行できます。React フロントエンド、認証・コンテナ管理・LLMプロキシ用の FastAPI ゲートウェイ、ユーザーごとの Hermes コンテナ、PostgreSQL ストレージ、知識ベース、スキルストア、cronジョブ、マルチチャネルボット、マルチモデル対応などの機能を備えています。

video-db/call.md

リアルタイムで会議を記録・音声認識し、ライブAIコーチング、会話メトリクス、自動会議後要約を提供するデスクトップアプリ。

new-sankaku/manga-editor-desu

プロフェッショナルなレイアウトとテキスト入力ツールを組み合わせ、オプションのAI画像生成とLLMプロンプト支援を提供するウェブベースのマンガ作成ツール。

EvolvingLMMs-Lab/NEO

NEOは、ピクセルと単語の処理を統一し、効率的なマルチモーダル理解を実現するために、エンコーダーフリーの密なアーキテクチャを採用した一連のネイティブな視覚言語モデルです。

TIGER-AI-Lab/VLM2Vec

テキスト、画像、動画、音声、および視覚的ドキュメントに対して固定次元のベクトルを生成する、全モダリティ対応の埋め込みモデルのトレーニングおよび評価のための統合フレームワーク。

roboflow/maestro

Florence-2、PaliGemma 2、Qwen2.5-VL などのマルチモーダル視覚言語モデルのファインチューニングを加速するための合理化されたツールです。

R3gm/SoniTranslate

SoniTranslateは、音声を同期させながら動画を異なる言語に翻訳するためのWebアプリケーションで、トランスクリプション、翻訳、音声ダブイングを1つのインターフェースで統合しています。

ailia-ai/ailia-models

視覚、音声、テキストなどのさまざまなドメインにわたる419の事前学習済みAIモデルのコレクションで、統一されたCLIと自動的な重みのダウンロードによりすべて実行可能です。

ohdearquant/lionagi

lionagi は、マルチエージェント LLM ワークフローの構築、実行、ガバナンスを行うための Python ライブラリおよび CLI です。型付きで永続化された会話状態を提供し、並列ファンアウトと DAG ベースのフローをサポート。モデル固有の CLI と API プロバイダーの両方を統合。Web UI(Lion Studio)により、実行の可視化管理が可能。

nikvdp/cco

cco は Claude Code や Codex などの AI コーディングエージェントを隔離環境で実行するサンドボックスラッパーで、プロンプトインジェクションや誤操作によるシステムへの影響を防ぎつつ、シームレスなターミナル体験を維持します。

Sportinger/MasterSelects

AIコーディングエージェントがクリエイティブプロセス中にワークスペース内に直接新しいツールやエフェクトを構築できる、ブラウザベースの動画・音声・3D用メディアエディタです。

OfficeDev/microsoft-365-agents-toolkit

Microsoft が提供するツールキット(VS Code/Visual Studio 拡張および CLI)で、Microsoft 365 Copilot、Teams、Office 用の AI 拡張機能、エージェント、チャットボットのスケルトン作成、デバッグ、デプロイが可能。認証ヘルパー、Azure Functions 対応、ホットリロードデバッグ、CI/CD パイプラインをバンドル。JavaScript/TypeScript および .NET 開発者を対象としています。

shrimbly/node-banana

画像、動画、音声、3Dコンテンツの複数プロバイダーにまたがる複雑なAIメディア生成パイプラインを構築するための視覚的ノードベースワークフローエディタです。

modelstudioai/cli

Aliyun Model Studio CLI (bailian‑cli) は、Alibaba Cloud の AI プラットフォーム用のターミナルツールで、テキスト、画像、動画、音声のマルチモーダル生成、アセット理解、マネージドエージェントオーケストレーション、データセット検証、ファインチューニング、デプロイ、アカウント管理を実行するためのコマンドを提供します。npm またはワンラインスクリプトでインストールでき、API キーまたは OAuth で認証後、`bl …` コマンドを実行するか、AI エージェントに自然言語プロンプトを翻訳して CLI 呼び出しに変換してもらうことができます。

NetManAIOps/ChatTS

ChatTS は、多変量時系列データをネイティブに理解し、推論できるマルチモーダル LLM であり、ユーザーが数値データに対して対話形式の質問応答を実行できるようにします。

jimmysu0309/shinkansen

Shinkansenは、Google Gemini、Google Translate、またはカスタムのOpenAI互換モデルを使用して、Webページ、YouTube字幕、ドキュメント(PDF、Word、EPUBなど)を翻訳する、本物のAI搭載ブラウザ拡張機能です。元のレイアウトとタイムスタンプを保持し、バイリンガル出力を提供し、プライバシーのためにファイルをローカルで処理します。

Graylab/IgFold

IgFoldは、アミノ酸配列から抗体の3D構造を予測する深層学習ツールであり、創薬のための高速かつ正確な構造モデリングを可能にします。

apple-aiml-research/ml-fastvlm

FastVLMは、ハイブリッドエンコーダー「FastViTHD」を用いる効率的な視覚エンコーディングフレームワークであり、高解像度画像の処理において、応答遅延とトークン数を劇的に削減します。

apple-aiml-research/ml-flextok

FlexTokは、画像を長さが柔軟な1次元トークン列に再サンプリングするシステムであり、画像を切り詰めても再構成が可能なシーケンスとして表現できるようにします。

merveenoyan/smol-vision

最先端の視覚およびマルチモーダルAIモデルを効率的かつパフォーマンス向上のために縮小・最適化・カスタマイズするためのレシピのコレクション。

sign/translate

手話動画を話す言語のテキストと音声に、また話す言語をアバターまたはGANを用いた手話にリアルタイムで双方向に変換するシステム。

Pangu-Immortal/MagicWX

ONNX、MediaPipe、MNN などのローカルランタイムを使用して、完全にオフラインのテキストチャットと Stable Diffusion 画像生成を実現する Android アプリ。

AIFrontierLab/TorchUMM

マルチモーダルモデルの推論、評価、およびポストトレーニングのための統一フレームワーク。単一のインターフェースを通じて、画像理解、生成、および編集をサポートします。

aiqm/torchani

TorchANI 2.0は、PyTorchベースのライブラリであり、GPU加速されたエネルギー/力予測、分子動力学およびML/MMシミュレーションのためのツールを提供し、ANIスタイルのニューラルネットワーク原子間ポテンシャルの訓練と使用を可能にします。

escalante-bio/mosaic

mosaic は、数十種類のタンパク質特性および構造予測モデルを統合した、JAXベースのPythonライブラリです。ユーザーが微分可能な損失項(結合親和性、安定性、溶解性、逆フォールディング尤度など)を組み合わせ、カスタム最適化アルゴリズムで連続リラクゼーション設計を実行できるため、1つのJIT加速フレームワーク内で多目的タンパク質工学が可能になります。このリポジトリには、Boltz、AlphaFold、OpenFold‑3、Protenix、ProteinMPNN、ESMなど、最先端のモデル、例のノートブック、詳細なドキュメントが含まれていますが、ユーザーはハイパーパラメータを調整し、GPU/TPU対応JAXインストールが必要です。

PozzettiAndrea/ComfyUI-Sharp

AppleのSHARPモデル用のComfyUIラッパーで、1秒未満で1枚の画像から3Dガウシアンスプラッティングを実現します。

2U1/Qwen-VL-Series-Finetune

Qwen-VLシリーズモデル(Qwen2-VL、Qwen2.5-VL、Qwen3-VL、Qwen3.5)をファインチューニングするためのトレーニングツールキットで、SFT、DPO、GRPO、およびマルチモーダルデータをサポートします。

tong-io/tongflow

TongFlow は、単純な「追加」「変換」「結合」ノードを接続することで、マルチモーダルな生成AIパイプラインを構築できるオープンソースのビジュアルスタジオです。テキスト、画像、動画、音声、3D、ドキュメントをサポートし、豊富なプラグインエコシステム(公式APIプラグイン、ルーター、GPU/CPU計算プラグイン)を備え、軽量なデスクトップクライアントまたはセルフホストバックエンドで利用可能です。AGPL-3.0ライセンス。

Simbastack-hq/framedex

すべてのファイルに対してプレーンテキストAI記述、字幕、メタデータサイドカーを生成する、動画および写真アーカイブ用の検索可能な知識ベース。

geekyutao/Inpaint-Anything

SAM と生成型インペイントモデルを統合したフレームワークで、画像、動画、3Dシーンにおけるオブジェクトの削除、埋め、置き換えを実現します。

dai-hongtao/InkTime

ビジョンモデルを使用して思い出をスコアリングおよびキャプション化し、「歴史上の今日」から最高の写真を毎日表示するAI搭載e-inkフォトフレーム。

AlexGladkov/claude-in-mobile

`mcp-devices`(別名 `claude‑in‑mobile`)は、モジュール式の Node/Rust サーバーで、Claude風AIエージェントが Android、iOS、ウェブ、デスクトップ、Aurora、HarmonyOS デバイスを制御できるようにします。ベースをインストール(`npm i -g mcp-devices`)、プラットフォームプラグイン(例:`@mcp-devices/plugin-android`)を追加し、有効化して、MCP互換クライアントをサーバーに接続します。スクリーンショット、タップ、UI検査、ライブデバッグ、テストなどの操作を提供し、AI駆動のデバイス自動化と体化エージェント研究を可能にします。

OTeam-AI4S/ODesign

特定のターゲットに結合するように設計されたタンパク質、リガンド、核酸を生成する、すべての原子を対象とした生成型ワールドモデル。

qntx/ovo

Ovo は、埋め込み可能でマルチエージェント対応のランタイムカーネルを提供する Rust ライブラリです。ホストアプリケーションは、Rhai スクリプトで実行される軽量なエージェント(turns)を起動でき、OS レベルのサンドボックス(macOS Seatbelt または Linux Landlock)をオプションで利用できます。このクレートは、承認ポリシーの設定、サンドボックスバックエンドトレイト、閉じ込められたファイルシステムアクセス用のオプションツールキットを提供します。現在のバージョンは前安定性(0.9.x)であり、MIT/Apache-2.0 の二重ライセンスです。

facebookresearch/MetaCLIP

英語のパフォーマンスを低下させることなく、高パフォーマンスな多言語画像-テキストアライメントを実現する、世界規模にスケーリング可能なCLIPのレシピ

skrub-data/skrub

skrub は、データフレームに焦点を当てたクリーニング、エンコーディング、類似性グループ化ツールを提供する Python ライブラリで、すべて scikit-learn 互換のトランスフォーマーとしてラップされ、表形式機械学習パイプラインの前処理段階を効率化します。

liangnjupt/VisTouch

ロボットのスライド接触から得られる映像、音声、触覚力データの大型同期データセット。素材認識とクロスモーダル学習に使用される。

livekit/rust-sdks

LiveKit の Rust クライアント SDK。デスクトップおよびモバイルプラットフォーム全体で、リアルタイムのビデオ/オーディオ/データストリーミング、ルーム管理、およびハードウェア加速エンコーディングを可能にします。

pinellolab/DNA-Diffusion

200bpの細胞型特異的な合成調控DNA配列を生成するための、拡散モデルベースの生成モデル。

OpenMOSS/AnyGPT

AnyGPTは、離散トークン化を用いてすべてのモダリティ(テキスト、音声、画像、音楽)を統一するオープンソースのマルチモーダルLLMです。ベースモデルとチャットモデルのチェックポイント、推論スクリプト、および訓練とゼロショットマルチモーダルタスク用のAnyInstructデータセットを提供しています。

MoonshotAI/Kimi-K2.5

Kimi K2.5 は、1兆パラメータのMoEアーキテクチャを備えたオープンソースでネイティブなマルチモーダルエージェントモデルであり、視覚と言語理解を統合して複雑なタスク実行を可能にします。

muthuishere/mcp-server-bash-sdk

MCP 2026-07-28 の純粋なBash実装で、AIエージェントツール呼び出しにゼロオーバーヘッドのstdioおよびローカルHTTPバインディングを提供します。`tool_*` 関数の自動発見、公式スキーマに基づくJSON検証、完全なテストスイート、およびカスタムBashベースMCPサーバー構築のステップバイステップドキュメントを備えています。

receptron/mulmocast-cli

JSONベースの中間言語「MulmoScript」を使用して、動画、ポッドキャスト、スライドデッキなどマルチモーダルコンテンツを生成するAIネイティブなプレゼンテーションプラットフォーム。

lupantech/MathVista

MathVistaは、視覚的文脈における基礎モデルの数学的推論能力を評価するベンチマークであり、31のマルチモーダルデータセットから抽出された6,141の例を統合しています。

jiaxiaogang/HE

he4oは、Helixエントロピー低減理論に基づくAGIシステムであり、事前に設計されたルールと動的学習を組み合わせることで、身体的知能と生涯学習を実現します。

Yu-Yang-Li/StarWhisper

天体観測の自動化、光度曲線およびパルサーの分類、天文学研究に特化したスキルパックを提供するAIフレームワーク。

gokayfem/ComfyUI_VLM_nodes

ビジョン・ランゲージ・モデル向けの本番向けComfyUIノードスイート。構造化された検出・セグメンテーション・適応型動画推論をVRAM最適化で提供。

AlekPet/ComfyUI_Custom_Nodes_AlekPet

ComfyUI用のカスタムノードのコレクションで、プロンプト翻訳、AI駆動コンテンツ生成、画像操作ツールを追加します。