johnson7788/MultiUserClaw
MultiUserClaw は Docker を基盤とした SaaS フレームワークで、多数のユーザー向けに隔離された AI アシスタント(Hermesエージェント)を実行できます。React フロントエンド、認証・コンテナ管理・LLMプロキシ用の FastAPI ゲートウェイ、ユーザーごとの Hermes コンテナ、PostgreSQL ストレージ、知識ベース、スキルストア、cronジョブ、マルチチャネルボット、マルチモデル対応などの機能を備えています。
video-db/call.md
リアルタイムで会議を記録・音声認識し、ライブAIコーチング、会話メトリクス、自動会議後要約を提供するデスクトップアプリ。
new-sankaku/manga-editor-desu
プロフェッショナルなレイアウトとテキスト入力ツールを組み合わせ、オプションのAI画像生成とLLMプロンプト支援を提供するウェブベースのマンガ作成ツール。
EvolvingLMMs-Lab/NEO
NEOは、ピクセルと単語の処理を統一し、効率的なマルチモーダル理解を実現するために、エンコーダーフリーの密なアーキテクチャを採用した一連のネイティブな視覚言語モデルです。
TIGER-AI-Lab/VLM2Vec
テキスト、画像、動画、音声、および視覚的ドキュメントに対して固定次元のベクトルを生成する、全モダリティ対応の埋め込みモデルのトレーニングおよび評価のための統合フレームワーク。
roboflow/maestro
Florence-2、PaliGemma 2、Qwen2.5-VL などのマルチモーダル視覚言語モデルのファインチューニングを加速するための合理化されたツールです。
R3gm/SoniTranslate
SoniTranslateは、音声を同期させながら動画を異なる言語に翻訳するためのWebアプリケーションで、トランスクリプション、翻訳、音声ダブイングを1つのインターフェースで統合しています。
ailia-ai/ailia-models
視覚、音声、テキストなどのさまざまなドメインにわたる419の事前学習済みAIモデルのコレクションで、統一されたCLIと自動的な重みのダウンロードによりすべて実行可能です。
ohdearquant/lionagi
lionagi は、マルチエージェント LLM ワークフローの構築、実行、ガバナンスを行うための Python ライブラリおよび CLI です。型付きで永続化された会話状態を提供し、並列ファンアウトと DAG ベースのフローをサポート。モデル固有の CLI と API プロバイダーの両方を統合。Web UI(Lion Studio)により、実行の可視化管理が可能。
nikvdp/cco
cco は Claude Code や Codex などの AI コーディングエージェントを隔離環境で実行するサンドボックスラッパーで、プロンプトインジェクションや誤操作によるシステムへの影響を防ぎつつ、シームレスなターミナル体験を維持します。
Sportinger/MasterSelects
AIコーディングエージェントがクリエイティブプロセス中にワークスペース内に直接新しいツールやエフェクトを構築できる、ブラウザベースの動画・音声・3D用メディアエディタです。
OfficeDev/microsoft-365-agents-toolkit
Microsoft が提供するツールキット(VS Code/Visual Studio 拡張および CLI)で、Microsoft 365 Copilot、Teams、Office 用の AI 拡張機能、エージェント、チャットボットのスケルトン作成、デバッグ、デプロイが可能。認証ヘルパー、Azure Functions 対応、ホットリロードデバッグ、CI/CD パイプラインをバンドル。JavaScript/TypeScript および .NET 開発者を対象としています。
shrimbly/node-banana
画像、動画、音声、3Dコンテンツの複数プロバイダーにまたがる複雑なAIメディア生成パイプラインを構築するための視覚的ノードベースワークフローエディタです。
modelstudioai/cli
Aliyun Model Studio CLI (bailian‑cli) は、Alibaba Cloud の AI プラットフォーム用のターミナルツールで、テキスト、画像、動画、音声のマルチモーダル生成、アセット理解、マネージドエージェントオーケストレーション、データセット検証、ファインチューニング、デプロイ、アカウント管理を実行するためのコマンドを提供します。npm またはワンラインスクリプトでインストールでき、API キーまたは OAuth で認証後、`bl …` コマンドを実行するか、AI エージェントに自然言語プロンプトを翻訳して CLI 呼び出しに変換してもらうことができます。
NetManAIOps/ChatTS
ChatTS は、多変量時系列データをネイティブに理解し、推論できるマルチモーダル LLM であり、ユーザーが数値データに対して対話形式の質問応答を実行できるようにします。
jimmysu0309/shinkansen
Shinkansenは、Google Gemini、Google Translate、またはカスタムのOpenAI互換モデルを使用して、Webページ、YouTube字幕、ドキュメント(PDF、Word、EPUBなど)を翻訳する、本物のAI搭載ブラウザ拡張機能です。元のレイアウトとタイムスタンプを保持し、バイリンガル出力を提供し、プライバシーのためにファイルをローカルで処理します。
Graylab/IgFold
IgFoldは、アミノ酸配列から抗体の3D構造を予測する深層学習ツールであり、創薬のための高速かつ正確な構造モデリングを可能にします。
apple-aiml-research/ml-fastvlm
FastVLMは、ハイブリッドエンコーダー「FastViTHD」を用いる効率的な視覚エンコーディングフレームワークであり、高解像度画像の処理において、応答遅延とトークン数を劇的に削減します。
apple-aiml-research/ml-flextok
FlexTokは、画像を長さが柔軟な1次元トークン列に再サンプリングするシステムであり、画像を切り詰めても再構成が可能なシーケンスとして表現できるようにします。
merveenoyan/smol-vision
最先端の視覚およびマルチモーダルAIモデルを効率的かつパフォーマンス向上のために縮小・最適化・カスタマイズするためのレシピのコレクション。
sign/translate
手話動画を話す言語のテキストと音声に、また話す言語をアバターまたはGANを用いた手話にリアルタイムで双方向に変換するシステム。
Pangu-Immortal/MagicWX
ONNX、MediaPipe、MNN などのローカルランタイムを使用して、完全にオフラインのテキストチャットと Stable Diffusion 画像生成を実現する Android アプリ。
AIFrontierLab/TorchUMM
マルチモーダルモデルの推論、評価、およびポストトレーニングのための統一フレームワーク。単一のインターフェースを通じて、画像理解、生成、および編集をサポートします。
aiqm/torchani
TorchANI 2.0は、PyTorchベースのライブラリであり、GPU加速されたエネルギー/力予測、分子動力学およびML/MMシミュレーションのためのツールを提供し、ANIスタイルのニューラルネットワーク原子間ポテンシャルの訓練と使用を可能にします。
escalante-bio/mosaic
mosaic は、数十種類のタンパク質特性および構造予測モデルを統合した、JAXベースのPythonライブラリです。ユーザーが微分可能な損失項(結合親和性、安定性、溶解性、逆フォールディング尤度など)を組み合わせ、カスタム最適化アルゴリズムで連続リラクゼーション設計を実行できるため、1つのJIT加速フレームワーク内で多目的タンパク質工学が可能になります。このリポジトリには、Boltz、AlphaFold、OpenFold‑3、Protenix、ProteinMPNN、ESMなど、最先端のモデル、例のノートブック、詳細なドキュメントが含まれていますが、ユーザーはハイパーパラメータを調整し、GPU/TPU対応JAXインストールが必要です。
PozzettiAndrea/ComfyUI-Sharp
AppleのSHARPモデル用のComfyUIラッパーで、1秒未満で1枚の画像から3Dガウシアンスプラッティングを実現します。
2U1/Qwen-VL-Series-Finetune
Qwen-VLシリーズモデル(Qwen2-VL、Qwen2.5-VL、Qwen3-VL、Qwen3.5)をファインチューニングするためのトレーニングツールキットで、SFT、DPO、GRPO、およびマルチモーダルデータをサポートします。
tong-io/tongflow
TongFlow は、単純な「追加」「変換」「結合」ノードを接続することで、マルチモーダルな生成AIパイプラインを構築できるオープンソースのビジュアルスタジオです。テキスト、画像、動画、音声、3D、ドキュメントをサポートし、豊富なプラグインエコシステム(公式APIプラグイン、ルーター、GPU/CPU計算プラグイン)を備え、軽量なデスクトップクライアントまたはセルフホストバックエンドで利用可能です。AGPL-3.0ライセンス。
Simbastack-hq/framedex
すべてのファイルに対してプレーンテキストAI記述、字幕、メタデータサイドカーを生成する、動画および写真アーカイブ用の検索可能な知識ベース。
geekyutao/Inpaint-Anything
SAM と生成型インペイントモデルを統合したフレームワークで、画像、動画、3Dシーンにおけるオブジェクトの削除、埋め、置き換えを実現します。
dai-hongtao/InkTime
ビジョンモデルを使用して思い出をスコアリングおよびキャプション化し、「歴史上の今日」から最高の写真を毎日表示するAI搭載e-inkフォトフレーム。
AlexGladkov/claude-in-mobile
`mcp-devices`(別名 `claude‑in‑mobile`)は、モジュール式の Node/Rust サーバーで、Claude風AIエージェントが Android、iOS、ウェブ、デスクトップ、Aurora、HarmonyOS デバイスを制御できるようにします。ベースをインストール(`npm i -g mcp-devices`)、プラットフォームプラグイン(例:`@mcp-devices/plugin-android`)を追加し、有効化して、MCP互換クライアントをサーバーに接続します。スクリーンショット、タップ、UI検査、ライブデバッグ、テストなどの操作を提供し、AI駆動のデバイス自動化と体化エージェント研究を可能にします。
OTeam-AI4S/ODesign
特定のターゲットに結合するように設計されたタンパク質、リガンド、核酸を生成する、すべての原子を対象とした生成型ワールドモデル。
qntx/ovo
Ovo は、埋め込み可能でマルチエージェント対応のランタイムカーネルを提供する Rust ライブラリです。ホストアプリケーションは、Rhai スクリプトで実行される軽量なエージェント(turns)を起動でき、OS レベルのサンドボックス(macOS Seatbelt または Linux Landlock)をオプションで利用できます。このクレートは、承認ポリシーの設定、サンドボックスバックエンドトレイト、閉じ込められたファイルシステムアクセス用のオプションツールキットを提供します。現在のバージョンは前安定性(0.9.x)であり、MIT/Apache-2.0 の二重ライセンスです。
facebookresearch/MetaCLIP
英語のパフォーマンスを低下させることなく、高パフォーマンスな多言語画像-テキストアライメントを実現する、世界規模にスケーリング可能なCLIPのレシピ
skrub-data/skrub
skrub は、データフレームに焦点を当てたクリーニング、エンコーディング、類似性グループ化ツールを提供する Python ライブラリで、すべて scikit-learn 互換のトランスフォーマーとしてラップされ、表形式機械学習パイプラインの前処理段階を効率化します。
liangnjupt/VisTouch
ロボットのスライド接触から得られる映像、音声、触覚力データの大型同期データセット。素材認識とクロスモーダル学習に使用される。
livekit/rust-sdks
LiveKit の Rust クライアント SDK。デスクトップおよびモバイルプラットフォーム全体で、リアルタイムのビデオ/オーディオ/データストリーミング、ルーム管理、およびハードウェア加速エンコーディングを可能にします。
pinellolab/DNA-Diffusion
200bpの細胞型特異的な合成調控DNA配列を生成するための、拡散モデルベースの生成モデル。
OpenMOSS/AnyGPT
AnyGPTは、離散トークン化を用いてすべてのモダリティ(テキスト、音声、画像、音楽)を統一するオープンソースのマルチモーダルLLMです。ベースモデルとチャットモデルのチェックポイント、推論スクリプト、および訓練とゼロショットマルチモーダルタスク用のAnyInstructデータセットを提供しています。
MoonshotAI/Kimi-K2.5
Kimi K2.5 は、1兆パラメータのMoEアーキテクチャを備えたオープンソースでネイティブなマルチモーダルエージェントモデルであり、視覚と言語理解を統合して複雑なタスク実行を可能にします。
muthuishere/mcp-server-bash-sdk
MCP 2026-07-28 の純粋なBash実装で、AIエージェントツール呼び出しにゼロオーバーヘッドのstdioおよびローカルHTTPバインディングを提供します。`tool_*` 関数の自動発見、公式スキーマに基づくJSON検証、完全なテストスイート、およびカスタムBashベースMCPサーバー構築のステップバイステップドキュメントを備えています。
receptron/mulmocast-cli
JSONベースの中間言語「MulmoScript」を使用して、動画、ポッドキャスト、スライドデッキなどマルチモーダルコンテンツを生成するAIネイティブなプレゼンテーションプラットフォーム。
lupantech/MathVista
MathVistaは、視覚的文脈における基礎モデルの数学的推論能力を評価するベンチマークであり、31のマルチモーダルデータセットから抽出された6,141の例を統合しています。
jiaxiaogang/HE
he4oは、Helixエントロピー低減理論に基づくAGIシステムであり、事前に設計されたルールと動的学習を組み合わせることで、身体的知能と生涯学習を実現します。
Yu-Yang-Li/StarWhisper
天体観測の自動化、光度曲線およびパルサーの分類、天文学研究に特化したスキルパックを提供するAIフレームワーク。
gokayfem/ComfyUI_VLM_nodes
ビジョン・ランゲージ・モデル向けの本番向けComfyUIノードスイート。構造化された検出・セグメンテーション・適応型動画推論をVRAM最適化で提供。
AlekPet/ComfyUI_Custom_Nodes_AlekPet
ComfyUI用のカスタムノードのコレクションで、プロンプト翻訳、AI駆動コンテンツ生成、画像操作ツールを追加します。