LYL1015/JarvisHub
編集可能なキャンバスを共有プロジェクト状態として使用する、キャンバスネイティブなオープンハーネス。長期的なクリエイティブ作業を管理するためのものです。
NVIDIA-AI-IOT/live-vlm-webui
ライブウェブカメラまたはIPカメラのストリームを使用して、Vision Language Model (VLM) とリアルタイムで対話およびベンチマークを行うための汎用Webインターフェース。
dnhkng/GLaDOS
視覚、長期記憶、低遅延応答パイプラインを持つ能動的なマルチモーダルAIパーソナフレームワーク。
Everless321/dYm
Douyin向けのデスクトップアプリケーションで、ウォーターマークのない動画ダウンロードとAIによるコンテンツ分析を組み合わせ、動画に自動的にタグ付けと要約を行います。
meangrinch/MangaTranslator
Gradioベースのウェブアプリで、会話ボブルの検出、元のテキストのクリーニング、AIによる翻訳テキストのレンダリングを通じて、マンガおよびコミックの翻訳を自動化します。
OpenTSLM/OpenTSLM
OpenTSLM は、Llama 3.2 および Gemma LLM にネイティブな時系列処理機能を追加するオープンソースライブラリであり、心電図(ECG)、脳波(EEG)、加速度計など医療信号に対する自然言語プロンプトと推論を可能にします。事前学習済みチェックポイント、シンプルな `OpenTSLM` Python API、複数のベンチマークタスク向けのデモスクリプト、MCQ、キャプション生成、連鎖的思考推論の各段階をカバーするカリキュラム学習トレーニングパイプラインを提供します。`pip install opentslm` でインストールし、Hugging-Faceからモデルを読み込み、提供されたスクリプトで微調整または評価が可能です。MITライセンス。
livekit/agents-js
STT、LLM、TTSのプラグインベースアーキテクチャを活用して、視覚・聴覚・理解が可能なリアルタイムでマルチモーダルな音声AIエージェントを構築するためのNode.jsフレームワーク。
uezo/aiavatarkit
複数のチャネルにわたって統合されたVAD、STT、LLM、TTSパイプラインを備えた、低遅延の対話型AIアバターを構築するためのモジュール式フレームワーク。
Nanako0129/pilotfish
pilotfishは、Claude Code向けのポリシー駆動型オーケストレーション層であり、低コストのClaudeモデル(Haiku、Sonnet)に低負荷のコーディングタスクを自動的に委任しながら、高レベルな計画と最終判断はメインのOpusセッションで行う。macOS/Linux用プラグインまたはレガシーグローバル設定でインストールされ、markdownでロールエージェントを定義し、インタラクションの形状とリスクに基づいて作業をルーティングする。プロジェクトにはドキュメント、ベンチマーク、MITライセンスが含まれる。
IvanWng97/pixtuoid
pixtuoidは、Rustで作られたターミナルUIで、複数のAIコーディングエージェントを、複数階のオフィス内にアニメーション付きピクセルアートの同僚として可視化します。Claude Code、Codexなど多くのエージェントCLIをサポートし、トークン使用量やツール活動を表示。テーマ、天気、ペット、ローフィサウンドトラックも搭載。すべてローカルで動作し、テレメトリなし。
Djdefrag/QualityScaler
DirectX12 対応 GPU を使用して、ローカルで画像と動画の品質を向上させ、解像度を拡大し、ノイズを除去する Windows 向け AI アップスケーラー。
pipecat-ai/pipecat-examples
Pipecat フレームワークを使用して、音声・多模態 AI エージェントを構築するための中級・上級のサンプルアプリケーション集です。
Tencent-Hunyuan/HY-Motion-1.0
Diffusion Transformers と Flow Matching を使用し、テキストプロンプトから骨格ベースのアニメーションを生成する、一連の十億パラメータ規模の Text-to-3D 人体動作生成モデルです。
huohua325/Memslides
MemSlidesは、パーソナライズされたスライド作成をサポートし、複数回のリビジョン(修正)に対応する、オープンソースの階層型メモリを備えたLLMエージェント・フレームワークです。ユーザープロファイル、作業用メモリ、ツールメモリを維持することで、偏好を一致させ、作業の重複を回避し、CLIとDockerイメージを提供して、実験を容易にします。
AHEKOT/ComfyUI_VNCCS_Utils
3D Gaussian Splatting、無限キャンバス画像編集、およびプロフェッショナルな3Dキャラクターのポージングとライティングのための高度なComfyUIユーティリティノード集。
AnubhavChaturvedi-GitHub/jarvis-ai-assistant
音声認識、LLM推論、画像生成、システム自動化を組み合わせ、ハンズフリーでコンピュータを操作できる、モジュール式の音声起動型AIデスクトップアシスタント。
yangjian102621/geekai
テキスト、画像、音声、動画の生成ツールを商用対応ワークスペースに統合した、ワンストップのAIマルチモーダルコンテンツ作成プラットフォーム。
timmyy123/LLM-Hub
AndroidおよびiOS向けのオープンソース・モバイルアプリ。ハードウェアアクセラレーションを利用して、デバイス上でのプライベートなLLMチャット、画像生成、動画生成を可能にします。
resend/resend-mcp
Resend MCP Server は、AI エージェント(Claude、Cursor、Copilot など)が完全な Resend メールプラットフォームを制御できるようにするオープンソースの Node.js パッケージです。ホストされたリモートサーバーまたはローカルで実行される stdio/HTTP サーバーのいずれかで動作し、メールの送信、連絡先の管理、テンプレート、ブロードキャスト、ドメイン、Webhook などを実行できます。
NickPittas/DirectorsConsole
画像と動画生成において、プロンプトを実世界のカメラ、レンズ、照明の制約に基づいて接地することで、映画撮影の正確性を保証する統合AI VFX制作パイプライン。
tensorforger/FluxRT
FLUX.2 用のリアルタイム・ストリーム編集パイプライン。コンシューマー向け GPU で、低遅延かつインタラクティブなプロンプト更新が可能なウェブカメラやビデオフィードを変換します。
OpenGVLab/Ask-Anything
チャット中心のビデオおよび画像理解のために設計された、マルチモーダル大規模言語モデルのファミリーであり、視覚的コンテンツに関する自然言語での対話を可能にします。
web-infra-dev/midscene-skills
スクリーンショットを使用して、Web、デスクトップ、モバイルプラットフォーム全体でUIの自然言語制御を可能にするビジョン駆動の自動化ライブラリ。
ZJUI-AI4H/Hulu-Med
Hulu‑Medは、テキスト、2D画像、3Dスキャン、動画を処理するオープンソースのマルチモーダル医療ビジョン言語モデルです。 複数のモデルサイズ(4 B~235 B)、完全な訓練コードを提供し、数十の医療ベンチマークで最先端の結果を達成しています。 リポジトリは簡単なインストール、HuggingFace互換の読み込み、高スループット推論のためのオプションのvLLMサービングを提供します。
pytorch/benchmark
PyTorch Benchmarks は、BERT、ResNet、Stable Diffusionなど人気のあるディープラーニングモデルの標準化・軽量版のコレクションであり、異なるPyTorchビルド、CUDAバージョン、バックエンドのパフォーマンスを測定するために実行できます。均一なAPI、インストールスクリプト、複数のランナー(シンプルテスト、pytest-benchmark、カスタムユーザーベンチマーク)に加え、AWS g4dn.metalインスタンスでの低ノイズチューニング用のユーティリティも提供しています。
agentuniverse-ai/agentUniverse
agentUniverse は、Apache-2.0 ライセンスの Python フレームワークで、LLM駆動のマルチエージェントアプリケーションの構築とオーケストレーションを可能にします。即時利用可能な協働パターン(PEER、DOE)、数十のLLMプロバイダー対応、ドメイン知識の注入ツール、OpenTelemetryによる監視性、視覚的ワークフローUIを提供します。アントグループの実際の金融製品で使用されており、GitHub/Discordに広範なドキュメント、サンプルアプリ、コミュニティが存在します。
landing-ai/ade-cli
根拠のあるMarkdownと検証可能な証拠(ページとボックス座標)を伴う構造化データに変換する、エージェント型ドキュメント抽出のためのコマンドラインツール。
meme-search/meme-search
AI ビジョンモデルを使用して、コンテンツとテキストに基づいて画像をインデックス化し、意味的およびキーワード検索を可能にする自己ホスト型ミーム検索エンジン。
tonyd2wild/DeepSeek-v4-Flash-Vision-Exp-DSpark-1M-NVFP4-KV-2x-DGX-Spark
DGX Sparkクラスタ上でDeepSeek-V4-Flash-Vision-Expを実行するためのデプロイレシピ。ネイティブなビジョンサポート、100万トークンのコンテキスト、およびvLLMを用いた高スループット予測デコードを実現します。
hawk86104/three-vue-tres
Three.js と Vue 3 を基盤にした AI 協働型 Web 3D エンジニアリングエコシステム。本番環境対応のデジタルツインと産業用可視化の構築を可能にします。
pengchujin/jzsub
複数のプラットフォームから高品質な動画をダウンロードし、GPT を使って二か国語字幕を生成・埋め込む自動化ツール。
thanhkeke97/RSTGameTranslation
OCRとLLMを使用して、画面上のテキストと音声をユーザーの言語に翻訳する、Windowsゲーム向けのリアルタイム画面翻訳ツールです。
OpenGVLab/InternVideo
マルチモーダルなビデオ理解、長文脈モデリング、および文脈推論のために設計された一連のビデオ基盤モデルと大規模データセット。
horang-labs/tessera
Tessera は、複数の Claude Code、Codex、または OpenCode AI コーディングエージェントを並行して実行できるローカルデスクトップ/Web アプリです。各エージェントは独立した Git ワークツリーで実行されます。カンバンボード、分割ペイン UI、ターミナル用チャットビュー、完全な Git 統合、モバイルリモートアクセスを提供し、マシンにインストール済みのプロバイダー CLI を使用します。
apple-aiml-research/ml-4m
トークン化とマスクモデル化を活用して、数十のモダリティとタスクにわたる任意のモダリティ間マルチモーダル基盤モデルのスケーリングを実現するフレームワーク。
inclusionAI/UI-Venus
閉ループ型の「知覚-推論-行動」システムを通じて、モバイル、Web、デスクトップのインタラクションを統合する汎用基盤GUIエージェント。
google/spatial-media
没入型メディアが正しく認識され、再生されるようにするための、360度動画および空間音声用の仕様とツールのコレクションです。
yincongcyincong/MuseBot
MuseBot は、Telegram、Discord、Slack、Lark、DingTalk、Enterprise WeChat、QQ、WeChat を、OpenAI、DeepSeek、Gemini、OpenRouter など多数のLLM API と接続するオープンソースのGoチャットボットです。AI応答をストリーミングで送信し、画像・音声入力、関数呼び出し、RAG、管理者UI、メトリクス、cronジョブをサポート。ローカルまたはDockerで実行可能。
strnad/CrewAI-Studio
CrewAI Studioは、Conda、仮想環境、Docker、またはワンクリックデプロイで簡単にインストールできる、StreamlitベースのGUIです。CrewAIフレームワークで構築されたマルチエージェントAIクルーを設計・実行・エクスポートでき、複数のLLMプロバイダーとカスタムツールをサポートしています。
facebookresearch/brain2qwerty
非侵襲的脳波記録から自然な文章を復元するシステムで、タイピング中の脳活動からテキストを再構成することを可能にする。
redis/mcp-redis
Redis MCP Serverは、PythonベースでDocker対応のサーバーであり、AIエージェントが自然言語コマンドでRedisとやり取りできるようにします。Model Content Protocolを実装し、文字列、ハッシュ、リスト、セット、ストリーム、JSON、ベクターインデックス、pub/subなど、すべてのRedisデータ型に対応するツールを公開しており、Azure Entra ID認証もサポートしています。PyPIまたはDockerからインストールでき、CLIフラグまたは環境変数で構成可能。Claude Desktop、OpenAI Agents SDK、または任意のMCPクライアントに接続できます。
wjq-learning/CBraMod
事前学習と微調整のパイプラインを通じて、臨床およびブレイン・コンピュータ・インターフェース(BCI)アプリケーション向けに設計された、EEGデコーディングのための基盤モデル。
awwaiid/ghostwriter
reMarkable タブレット用の AI アシスタント。手書き入力をスクリーンショットで取得し、画面に直接描画またはタイプして応答する。
nvidia-cosmos/cosmos-transfer2.5
物理AI向けのマルチコントロールネットプラットフォーム。深度やセグメンテーションなどの動画モダリティを、ロボットや自律車両の高精細なトレーニングデータに変換します。
bytedance/Lance
Lanceは、画像および動画の理解、生成、編集を1つのフレームワークに統合した30億パラメータの統合マルチモーダルモデルです。
bytedance/Sa2VA
Sa2VAは、SAM‑2セグメンテーションとマルチモーダルLLM (InternVL, Qwen‑VL) を融合させ、画像や動画のピクセルレベルのグラウンデッドな理解を提供するための、ByteDanceの研究用コードベースです。コアとなるSa2VAモデル、VRT推論ベンチマーク、SAMTokマスク・トークン・インターフェース、および SaSaSa2VA のような拡張機能が含まれています。リポジトリは再現可能な環境構築のために `uv` パッケージマネージャーを使用し、セットアップスクリプトを提供し、論文、モデル・ズー、モデル・データセットへのリンクを提供しています。
fikrikarim/parlor
Gemma 4とKokoro TTSを使用し、低遅延の音声およびビジョンインタラクションを可能にする、完全オンデバイスのリアルタイム・マルチモーダルAIアシスタント。
MaximeVandegar/Papers-in-100-Lines-of-Code
初期のディープラーニングのマイルストーンから最新のニューラルレンダリングや拡散モデルまでをカバーする、約64の超コンパクト(約100行)の実装のキュレートされたセット。学習とプロトタイピング用に設計されており、各論文に対してMITライセンスのもとで最小限で実行可能なコードを提供します。