tiiuae/Falcon-Perception
Falcon‑Perceptionは、Falconマルチモーダルトランスフォーマー向けのオープンソースPyTorch/MLX推論ライブラリで、自然言語クエリに応じてオブジェクト検出、インスタンスセグメンテーション、またはOCRを実行できます。高度に最適化されたページド・バッチエンジン、FastAPIサーバー、Streamlit UI、Docker/vLLMによるOCRデプロイ、Colabノートブックを提供。270 MパラメータのFalcon‑OCR 1.5モデルは、はるかに大きなVLMと同等のエンドツーエンドOCR品質を実現しながらも、3倍小さく、リアルタイムやエッジデプロイに適しています。
notepower2k1/CapCap
Faster-WhisperやさまざまなTTSエンジンなどのAIモデルを使用して、文字起こし、翻訳、および吹き替えを自動化するビデオローカライズ用のWindowsアプリケーション。
dabit3/react-native-ai
リアルタイムLLMストリーミングと画像生成を内蔵した、クロスプラットフォームモバイルAIアプリを構築するためのフルスタックフレームワーク。
Kazama-Suichiku/Houdini-Agent
Meshy AIを活用した、ノードネットワークの自動生成、VEX/Pythonコード作成、3Dアセット生成を実現するSideFX Houdini用の自律型AIアシスタント。
oracle/mcp
LLMベースのツールがOracle Cloudサービスと対話できるようにするModel Context Protocol (MCP) サーバーのリファレンス実装。多言語(Python, Node.js, Java)対応サーバー、stdioまたはHTTPトランスポート、コンテナサポート、およびCline、Cursor、mcphost向けのクライアント設定スニペットを提供します。
OpenMOSS/MOVA
MOVAは、テキストプロンプト(オプションで参照画像あり)から同期された動画+音声を生成するオープンソースモデルです。デュアルタワー型の動画音声アーキテクチャを採用し、360p/720pのチェックポイント、推論スクリプト、LoRA微調整パイプライン、評価コード、SGLang、ComfyUI、ホストAPIとの統合を提供しています。
MaxBittker/rs-sdk
RS‑SDK は、ボット研究向けに RuneScape 風 MMO をエミュレートするオープンソースで TypeScript で構築されたスターターKITです。サーバーエミュレータ、ウェブクライアント、ゲートウェイ、型安全な SDK をバンドルしており、非同期スクリプト(または LLM 生成コード)を書くことでボットを制御し、目的指向合成、マルチエージェント競争、市場経済の実験が可能です。デモサーバーは即時利用可能で、調整可能なタックレートでローカルホストも可能。MIT ライセンスで、Discord コミュニティがサポートしています。
xandergos/terrain-diffusion-mc
拡散モデルを使用して高度に多様でリアルな地形と風景を生成する Minecraft Fabric Mod です。
OpenVGLab/OmniLottie
OmniLottie は、事前学習済みのビジョン‑ラングエッジモデルを使用して、テキスト、画像、または動画入力から複雑なベクター Lottie アニメーションを生成するマルチモーダル AI ジェネレーターです。
HELPMEEADICE/TE-Speed-MiniMaxH3-OSS
DiTブロックの残差キャッシュ機構を使用して、ComfyUIにおけるMiniMax H3モデルの推論を最大45%高速化するカスタムノード。
Ariescar/anyCreature
テキスト記述を、マルチステージの設計と検証プロセスを経て、ゲーム用に最適化されたアニメーション付き3Dクリーチャー(GLB形式)に変換するAI駆動のパイプライン。
bquenin/interpreter
OCRとローカルLLMを使用して、フローティングオーバーレイ経由でリアルタイムの英語字幕を提供する、日本のレトロゲーム用オフライン画面翻訳ツール。
merveenoyan/smol-vision
最先端の視覚およびマルチモーダルAIモデルを効率的かつパフォーマンス向上のために縮小・最適化・カスタマイズするためのレシピのコレクション。
pwilkin/trellis.cpp
GGMLを用いたスタンドアロンのC++実装により、実行時にPythonを必要とせず、画像からテクスチャ付き3Dモデルを生成するTRELLIS画像から3Dへのパイプラインを実現。
microsoft/unilm
Microsoftが提供する、テキスト、ビジョン、音声、マルチモーダルタスクにわたる大規模な自己教師付き事前学習を対象とした、包括的な基礎モデルとアーキテクチャのコレクション。
oxbshw/watch-skill
動画、音声、画面活動をタイムスタンプ付きの証拠に変換する認識・検証エンジンで、決定論的検証システムと専用エージェントワークスペースを備えています。
tegnike/aituber-kit
OpenAI、Anthropic、Google Gemini、Ollama、LM Studio など、さまざまなLLM、TTSエンジン、2D/3Dアバターをサポートする、インタラクティブなAIキャラクター(AITuber)を作成するためのオールインワンツールキット。
1038lab/ComfyUI-QwenVL
画像と動画の理解のためにQwen-VLビジョン言語モデルを統合するComfyUI拡張機能。デュアルHFとGGUFバックエンド、およびGPU最適化推論を特徴としています。
bkingfilm/lapian-notes
ローカルで動作する映画分析ツールで、フレームと字幕を抽出し、AI支援の物語構造ツリー、プロットのスイムレーン、感情曲線を生成します。
NVIDIA-BioNeMo/bionemo-agent-toolkit
NVIDIAのモデルやライブラリを使用して、タンパク質折りたたみ、分子ドッキング、ゲノミクス解析などのタスクを実行できるようにする、AIエージェント向けの専門的生命科学スキルのツールキットです。
fangwei123456/spikingjelly
SpikingJellyは、PyTorchベースのオープンソースライブラリで、スパイキングニューラルネットワーク(SNN)の構築、学習、デプロイを可能にします。ニューロンモジュール、ANNからSNNへの変換、複数バックエンド加速(torch、CuPy、Triton)、大規模学習ユーティリティ、ニューロモルフィックデータセットローダー、プロファイリングツール、ニューロモルフィックハードウェア向けエクスポートインターフェースを提供します。Python ≥ 3.11 および PyTorch ≥ 2.6 を必要とし、Open-Intelligence Open Source Licenseの下でリリースされています。
facebookresearch/VLM3
VLM³は、テキストベースの出力とデータスケーリングのみを使用して、標準的なビジョン言語モデル(VLM)が深度推定やカメラポーズ推定などの3Dビジョンタスクを実行できるようにするフレームワークです。
sakalond/StableGen
TRELLIS.2 と ComfyUI を統合したBlenderアドオンで、テキストまたは画像から3Dメッシュを生成し、既存のモデルにAI駆動のテクスチャを適用します。
katanaml/sparrow
Vision LLMsとエージェントワークフローを使用して、請求書、領収書、明細書を構造化されたJSONに変換する、エンタープライズ向けドキュメントインテリジェンスのAPI-firstプラットフォームです。
BIT-DataLab/Edit-Banana
SAM 3 とマルチモーダル LLM を使用して、図やフローチャートの静的画像を編集可能な DrawIO XML ファイルに変換するツールです。
ZJU4HealthCare/HealthGPT
医療テキスト、2D画像、3Dボリュームを統合する医療用マルチモーダル大規模言語モデルのファミリー。高度な医療理解と生成を実現。
microsoft/Biodiversity
生物多様性モニタリング向けのオープンソース AI ツール集で、カメラトラップ画像、バイオアコースティクス、航空画像、ソナーにおける動物検出モデルを提供します。
NX-AI/xlstm
xLSTMは、指数ゲートと行列メモリを導入した新しい再帰型ニューラルネットワークアーキテクチャであり、大規模言語モデル(例:70億パラメータモデル)へのスケーリングを可能にします。リポジトリにはPyTorchコード、カスタムCUDA/Tritonカーネル(`mlstm_kernels`パッケージ経由)、単一ファイルの70億パラメータ実装、設定ユーティリティ、およびHugging Face上の事前学習済み重みが含まれます。インストールはconda + pipで行い、NVIDIA GPU(高速Tritonカーネル)で動作し、AMDやApple Silicon向けのフォールバックも提供されています。
catlog22/maestro-flow
Maestro‑Flow は、自然言語の意図を、複数のLLMエージェント(Claude、Gemini、Codexなど)によって実行されるフルスタック開発パイプラインに変換するTypeScript/Node.jsフレームワークです。そのRalphエンジンは40以上のコマンドチェーンに意図を分類し、『決定』チェックポイントで継続、ロールバック、または修復ループの挿入を動的に判断し、発見されたパターンをSQLite知識グラフに自動保存して以降の実行に注入します。4つの協調モード(Delegate、Team、Wave、Swarm)、Odysseyコマンドによる長時間自律ループ、正確なリテラル/意味的コード検索をサポートします。インストールは `npm i -g maestro-flow` で行い、CLIおよびWebダッシュボードのドキュメントが豊富です。
VILA-Lab/FigMirror
FigMirrorは、ユーザーのデータを、提供されたリファレンス科学図のスタイルで自動的にMatplotlibコードを生成するエージェント型ツールです。
OFA-Sys/Chinese-CLIP
2億組の画像-テキストペアで学習された、クロスモーダル検索およびゼロショット画像分類のための中国語版CLIPモデル。
anysearch-ai/anysearch-mcp-server
AnySearch MCP Server は、リアルタイムで動作する MCP 互換バックエンドで、一般ウェブ検索、垂直ドメイン検索、並列バッチ検索、URLコンテンツ抽出を提供します。OpenCode、Claude Code、Cursor、VS Code、Windsurf、Cline などの人気AIアシスタントIDEと、シンプルなJSON設定で連携可能。APIキー認証をオプションでサポートし、レートリミットを引き上げられ、匿名利用も可能。READMEには登録手順、キーの取り扱い、クライアント固有の設定スニペット、および4つのツールエンドポイント(`search`、`get_sub_domains`、`batch_search`、`extract`)の詳細が記載されています。
jtydhr88/ComfyTV
画像、動画、音声、音楽、3DアセットのためのAI生成とプロフェッショナル編集ツールを統合した、ComfyUI用のキャンバスベースメディアワークベンチです。
valentinfrlch/ha-llmvision
LLM Visionは、マルチモーダル大規模言語モデル(OpenAI, Anthropic, Gemini, Ollamaなど)を使用して、画像、ビデオクリップ、ライブカメラ映像、およびFrigateイベントを分析するHome Assistant統合機能です。自然言語による説明、識別された人物/ペット/物体を記憶し、分析結果をダッシュボードに表示したり、Assistで照会したりできるタイムラインに保存します。HACS経由でインストールし、LLMプロバイダーを設定し、オプションで提供されるBlueprintを使用して、AIによる要約されたカメラ通知を受け取ることができます。
NoizAI/HelixWorld
HelixWorldは、ユーザーの動きに基づいて音と視覚が同期して更新される、ナビゲーション可能な環境を生成するリアルタイムのインタラクティブな音響・視覚ワールドモデルです。
tryonlabs/opentryon
バーチャル試着、画像・動画生成、およびマルチモーダル理解のための統一されたインターフェースを提供する、ファッションテクノロジー向けのオープンソースAIツールキット。
CronusL-1141/AI-company
AI Team OS は、Claude風のLLMを自律的で「CEO」として動作させるオープンソースプラットフォームです。継続的に動作し、専門エージェント、タスクウォール、研究パイプライン、二層メモリシステムをオーガナイズします。FastAPI + Reactダッシュボードでは、リアルタイムのワークフロー、意思決定トレース、すべてのメモに対する統合検索を表示します。技術的創業者や研究チームがAIファースト、自律運転型のワークフローを実現したい場合に最適です。
om-ai-lab/VLM-R1
VLM-R1 は、GRPO を使用して R1 スタイルの大規模ビジョン・言語モデルを訓練し、視覚的グラウンディング、数学、物体検出などのタスクにおける推論と汎化を向上させるフレームワークです。
StanfordMIMI/Merlin
Merlinは、CTスキャン用の3D視覚言語基盤モデルおよびデータセットであり、CTスキャンと電子健康記録および放射線レポートを統合して医療分析を行います。
OpenBMB/MiniCPM-V-Apps
iOS、Android、HarmonyOS向けのオンデバイスデモアプリのコレクションで、MiniCPM-Vファミリーのマルチモーダルおよびテキストモデルをllama.cppを介して完全にローカルで実行できます。
Intent-Lab/VisionClaw
Gemini Liveを活用し、視覚・聴覚を認識し、OpenClaw統合により行動を実行するリアルタイムAIアシスタント。
TinyLLaVA/TinyLLaVA_Factory
さまざまなLLM、ビジョンタワー、コネクタをサポートする、小規模大規模マルチモーダルモデルを構築・訓練するためのモジュール化されたコードベース。
Anionex/agent-vision-toolkit
画像Q&AおよびGUI自動化のためのタスクに特化した視覚ツールと、シームレスなプロキシ統合を通じて、テキストのみのLLMエージェントに視覚能力を付与するツールキット。
fruitbars/simple-one-api
simple‑one‑api は、複数のLLMプロバイダーをOpenAI互換のエンドポイントに統合し、容量を考慮したキー・スケジューリング、4層のレート制限、内蔵のReactチャットUI、視覚的な設定コンソール、およびWailsデスクトップクライアントを提供するオープンソースのGoゲートウェイです。単一のバイナリ、Dockerコンテナ、またはデスクトップアプリとして実行可能で、設定はSQLiteに保存されます。
nikkigallery/Whimbox
LLMと画像認識を活用し、画面キャプチャと入力シミュレーションによって、ゲーム『Infinity Nikki』における日常タスク、ナビゲーション、アクティビティの自動化を実現するAIエージェント。
MooreThreads/torch_musa
torch_musa は、Moore Threads GPU用の **MUSA** バックエンドを追加する PyTorch 拡張です。標準の PyTorch API を模倣しており、`cuda` を `musa` に置き換えるだけで利用可能です。C/C++ 拡張のビルドツール、**mccl** バックエンドによる分散トレーニング、および簡単なセットアップ用の Docker イメージを含んでいます。また、torchvision、torchaudio、およびその他の人気 PyTorch ライブラリの MUSA 対応ビルドも提供しています。事前ビルドされた wheel からインストールするか、MUSA SDK をインストール後にソースからビルドできます。プロジェクトは BSD ライセンスです。
crisng95/flowboard
Google Flowを通じて、一貫したキャラクターや製品を画像や動画に構成するためのグラフベースのアプローチを使用する、ローカル専用の無限キャンバスワークスペース。
kyutai-labs/unmute
低遅延の音声認識(STT)および音声合成(TTS)モデルでテキストLLMをラップすることで、テキストベースのLLMが音声で会話できるようにするシステム。