xszyou/Fay
LLM、ASR、TTSを統合し、アプリ、ウェブサイト、組み込みデバイス向けのインタラクティブなバーチャルアバターを実現する包括的なデジタルヒューマンフレームワーク。
lycohana/BiliSum
BiliSumは、Bilibili、YouTube、およびローカルの動画を、文字起こし、視覚的なノート、およびローカル RAG 駆動の知識ベースに変換する、動画から知識への変換ツールです。
death34018-hue/AionsHome
マルチモーダルチャット、スマートカメラ監視、RAGベースのメモリを統合したローカルホスト型AIアシスタントシステムで、能動的な個人アシスタントを実現します。
google-labs-code/stitch-sdk
テキストプロンプトからUIスクリーンを生成・編集するTypeScript SDK。迅速なプロトタイピングとAIエージェント統合のためのHTMLとスクリーンショットを提供します。
omicverse/omicverse
OmicVerseは、バッチRNA-Seq、シングルセル、空間トランスクリプトミクス解析を統合するPythonライブラリです。数十の確立されたバイオインフォマティクスツールをバンドルし、anndata/mudataデータ構造を標準化し、AI支援エージェント(J.A.R.V.I.S.)とMCPサーバーを追加して、自然言語コマンドやLLM統合でパイプラインを実行可能にします。オプション拡張により合成生物学モデリングとGPU加速分子動力学ワークフローも提供します。
xandergos/terrain-diffusion
拡散モデルを用いて無限・決定的・ランダムアクセス可能なリアルタイムの地形・気候データを生成する、学習済みの Perlin ノイズの後継。
oil-oil/wolfcha
Wolfchaは、1人の人間がAI制御の個性を持つフルテーブルのウルフゲームをプレイできるWebゲームです。AIは過去の対話を記憶し、意図を持って行動し、リアルタイムで発話(オプションの音声付き)を生成し、他の人間のプレイヤーを必要とせずに、混沌とした社会推論体験を再現します。
PunithVT/ai-avatar-system
リアルタイムリップシンク、ゼロショット音声クローン、マルチLLM対応を備えた、本番環境で利用可能な写実的なAIアバター構築プラットフォーム。
LC044/TrailSnap
AIを活用したセルフホスト型フォトアルバムで、チケットのOCR、顔認識、地理的フットプリントマッピングを通じて旅行の思い出を自動的に整理します。
ashuoAI/SHUO-Canvas
SHUO Canvasは、デスクトップ型のノードベースキャンバスで、テキスト、画像、動画、音声をAI生成(OpenAI互換、RunningHub、ComfyUIなど)と組み合わせて、スクリプト、ストーリーボード、キャラクターアップ動画、360°パノラマ、ボイスオーバー、3Dシーンなどを1つの視覚的ワークフロー内で構築できる。
MashiroSaber03/Saber-Translator
テキスト検出、OCR、翻訳、画像インペイントを自動化するAI駆動のマンガ翻訳・管理ツール。RAGベースのストーリー分析エンジンを搭載。
jipraks/yt-short-clipper
LLMを使用してYouTube動画のハイライトを識別し、自動的にキャプション付きの9:16縦型クリップに変換するWindowsデスクトップアプリ。
vanloctech/youwee
1,800 以上のサイトから動画をダウンロードできるオープンソースの GUI で、統合された AI 動画要約、自然言語編集、AI ベースの字幕生成を提供します。
openstory-so/openstory
一貫したキャラクターとビジュアルスタイルを備えた、スクリプトをスタイリッシュなビデオシーケンスに変換するAI搭載ビデオ制作プラットフォーム。
Softeria/ms-365-mcp-server
LLM 向けに Microsoft 365 Graph API を MCP ツールとして公開する Node.js サーバー。個人アカウントと組織アカウント、マルチアカウント利用、権限フィルタリング、および実験的なトークン節約型 TOON 出力形式をサポートします。
google-deepmind/alphagenome_research
AlphaGenomeは、遺伝子発現、スプライシング、クロマチン特徴において、調節的遺伝的バリアントの影響を単一塩基対解像度で予測する統合型DNA配列モデルです。
facebookresearch/eb_jepa
画像および動画間で予測と計画のための表現を学習するために使用されるエネルギーベースの共同埋め込み予測アーキテクチャ用の軽量なライブラリです。
huangjunsen0406/py-xiaozhi
py‑xiaozhi は、音声、視覚、ハードウェア制御が可能なマルチモーダル AI アシスタントを構築するための、非同期優先の Python フレームワークです。
NVlabs/FastGen
画像・動画生成のために、さまざまな蒸留・加速手法を用いて拡散モデルを高速化する PyTorch ベースのフレームワーク。
ogkalu2/comic-translate
LLM、OCR、およびインペインティングを使用して、元の視覚的レイアウトを維持しながら、多言語の漫画やマンガを翻訳する自動漫画翻訳ツールです。
microsoft/skills-for-copilot-studio
Skills for Copilot Studio は、Claude Code、GitHub Copilot CLI、VS Code 用のプラグインで、Microsoft Copilot Studio の「標準」エージェントを YAML ファイルを使用して作成、編集、同期、テスト、設計アドバイスを取得できます。すべてターミナルまたはエディターから操作できます。
NVIDIA/TransformerEngine
NVIDIA Transformer Engineは、FP8/MXFP8/NVFP4の混合精度サポート、融合カーネル、およびPyTorchとJAX向けのシンプルなautocast APIを提供するGPU特化型ライブラリであり、大規模言語モデルやMoEモデルの高速化、メモリ節約、効率的なトレーニングと推論を可能にします。
Alos21750/UAV-Downloader
UAV Downloader は、JableTV、MissAV、SupJav、Hanime1 に対応する Windows 向けの動画ダウンローダーで、ローカル音声認識(ReazonSpeech K2 v2 または Whisper)および翻訳モデル(FuguMT、OPUS-MT)を使用して、日本語、英語、繁体中国語の字幕を自動生成できます。3つの操作モード(インタラクティブGUI「UAV Browser」、非対話型スケジューラ「UAV Watcher」、ヘッドレスDocker/CLI版)を提供し、プロキシ対応、並列ダウンロード、オプションのLLMベース翻訳を備えています。プロジェクトは Apache 2.0 ライセンスで公開され、デフォルトではオフラインで動作します。
tianjiangqiji/nova-image-studio
ユーザーが独自のモデルを導入し、プラグインシステムで機能を拡張できるセルフホスト型AI画像・動画生成ワークベンチ。
wassermanproductions/motion-previs-studio
映画監督向けのデスクトップアプリで、参照動画からポーズ、深度、カメラの動きを抽出し、AI動画生成パイプライン用のコントロールバンドルを作成します。
FlowElement-xinliuyuansu/m_flow
M-flow は、知識グラフにおける証拠パスのスコアリングを通じて情報を取得することで、AI エージェントのための記憶システムとして機能し、類似度検索に頼るだけではなく、認知的記憶システムのように動作します。
visualbruno/ComfyUI-Trellis2
ComfyUI‑Trellis2 は、視覚プログラミングUIであるComfyUIにマイクロソフトのTRELLIS.2 3D拡散モデルを統合するカスタムノードパックです。単一または複数の画像(または動画)からメッシュの生成、精緻化、テクスチャ付与、レンダリングまでを数十のノードで実現します。Windows、Python 3.11、PyTorch 2.7/2.8 + CUDA、Facebook DINOv3チェックポイントが必要です。ネイティブ拡張用の事前ビルド済みwheelが同梱され、例のワークフローも含まれます。本格的なAI/MLプロジェクトであり、3D生成に特化しています。
Asad-Ismail/MoneyPrinterTurbo-Extended
スクリプトの生成、ローカル音声クローンによる音声合成、および同期された単語レベルの字幕付きの関連動画クリップのマッチングを行う自動動画生成ツール。
opentokenz/mcpx
MCPX は、MCP プロトコルを実装する Go ベースのローカルサーバーです。これにより、LLM エージェント(ChatGPT、Claude など)が、登録されたローカルワークスペース内で、ファイル、コマンド、プラン、アーティファクトを安全に読み書き、実行、管理できるようにします。永続的な Remote Session、きめ細かなセキュリティポリシー、SQLite に保存される監査ログ、および Skills やカスタムツールによる拡張性を提供します。
jangles-byte/Pythia
40以上のリアルタイムデータフィードを統合し、3Dインテリジェンスグローブで世界の出来事を予測するローカルで群れ知能型のグローバル予測システム
NVIDIA-BioNeMo/Proteina-Complexa
原子レベルのタンパク質バインダー設計のための生成モデルで、生成モデリングと幻覚を統合し、タンパク質および小分子リガンドに対するバインダーを生成する。
aurekaresearch/OpenDDE
すべての原子を扱う生体分子基盤モデルで、創薬における構造予測、設計、最適化に向けた共フォールディングを実現。
OpenBMB/MiniCPM-o-Demo
MiniCPM-o 4.5用のデモシステムで、AIが同時に視覚認識、音声認識、音声出力をリアルタイムで行える双方向オムニモーダル対話が可能。
mynaparrot/plugNmeet-server
LiveKitを基盤とするスケーラブルでオープンソースのウェブ会議システム。AIによる音声認識と要約機能を備えた自己ホスト型ビデオ会議を提供。
bytedance/SALMONN
汎用的な聴覚能力と統合された音声・視覚認識を備えた高度なマルチモーダルLLMのスイート。
mcp-router/mcp-router
MCP Routerは、廃止されたオープンソースのデスクトップアプリ(Windows/macOS)で、ローカルに配置されたModel Context Protocol (MCP) サーバーを管理します。ユーザーはサーバーをプロジェクトやワークスペースにグループ化し、個々のツールを切り替え、リクエストログや基本的な分析データを確認できます。また、人気のあるAIフロントエンドと統合可能です。すべてのデータはユーザーのマシン上に保持されます。最終リリースバージョンは v0.6.4(サポート終了日:2026年9月)です。
NVIDIA-NeMo/Megatron-Bridge
NeMo Megatron Bridge は、Hugging Face モデルのチェックポイントと NVIDIA の Megatron‑Core トレーニングエンジンを接続する PyTorch ネイティブライブラリです。双方向のチェックポイント変換、検証、および高スループットトレーニング(テンソル/パイプライン並列、FP8/BF16/FP4)を提供します。リポジトリには、数十の LLM、VLM、拡散モデル(例:Llama 3.2、Nemotron‑3 Ultra、K‑EXAONE‑2)向けの既製レシピが同梱されており、SFT/LoRA ファインチューニングをサポートしています。公式の NeMo Docker コンテナまたはソースからインストールし、提供されているクイックスタートスクリプトを使用してモデルの変換、トレーニング、エクスポートができます。
tl2012tl/TE_MAN
TE MANは、無限キャンバス・ワークフロー、アセットライブラリ、オーディオ/ビデオ/画像ノード、3Dディレクター、バッチプロンプト・ツール、およびAIアシスタント・チャットパネルを追加するComfyUIプラグインであり、画像、ビデオ、およびマルチモーダル生成において、ローカルモデルの推論とリモートAPIの利用を両立させます。
nagadomi/nunif
画像の超解像、VR向け2Dから3D動画変換、データセットフィルタリングのための画像品質評価を実現するPyTorchベースのツールのコレクション。
ysr666/dsh-vision-router
DeepSeek Harness向けのビジョンルーティングプラグインで、エージェントがツールコールを通じて画像ピクセルとやり取りでき、内蔵のキーレス無料フォールバックを提供する。
tracel-ai/cubecl
CubeCLはRustのプロシージャルマクロベースの言語で、単一の計算カーネルをRustで書き、CUDA、HIP、Metal、WebGPU(WGSL/SPIR-V)、またはCPU SIMDにJITコンパイルできます。並列性を4つの軸(ベクトル、プレーン、キューブ次元、キューブ数)でモデル化し、コンパイル時特殊化、自動ベクトル化、実行時オートチューニングをサポートし、Rust深層学習フレームワークBurnとカーネルライブラリcubekの低レベル基盤を形成します。
nicolasvonluetzow/GaussianGPT
GaussianGPTは、次トークン予測を用いて3Dガウスシーンを生成するトランスフォーマー基盤のモデルであり、制御可能な3Dシーン生成、補完、アウトペインティングをサポートしています。
MiniMax-AI/MiniMax-MCP
ClaudeやCursorなどのAIクライアントが、MiniMax APIを使用して音声生成、音声クローニング、画像および動画の作成を可能にする、公式のModel Context Protocol (MCP) サーバー。
InternLM/Intern-S1
化学や生物学のような複雑な科学分野にまたがる推論が可能で、科学的インテリジェンスと長期エージェント向けに最適化された一連のマルチモーダル基盤モデル。
ZeroTang05/cyber-doctor
RAG、知識グラフ、音声インタラクションを活用した、病気の診断と医療記録分析を行うマルチモーダルAIヘルスアシスタント。
ACEsuit/mace
MACEは、等変換グラフニューラルネットワーク原子間ポテンシャル用のオープンソースPyTorchライブラリです。高速なトレーニング/評価、マルチGPUおよびApple-Silicon対応、オプションのCUDA加速、材料および有機化学向けの事前学習済み基礎モデルのカタログを提供します。`pip install mace-torch`でインストールでき、`mace_run_train` CLI(またはYAML設定)でトレーニング、`mace_eval_configs`で評価が可能です。ドキュメント、Colabチュートリアル、Weights & Biases統合も含まれます。v0.3ラインは安定しており、大規模なv1.0リファクタリングが進行中です。
danilo-znamerovszkij/draw-your-font
ローカル処理とオプションのAIビジョンによる文字ラベル付けを用いて、手書きの写真をインストール可能なTTF/WOFFフォントに変換するオープンソースツール。
tracefinity/tracefinity
AIによるシルエット追跡とスケール校正を使用して、工具の写真からカスタムのGridfinity 3Dプリント用ビンを生成するツール。