NVlabs/GRAIL

3Dアセットとビデオの事前知識から4Dの人間と物体の相互作用の軌道を合成し、ヒューマノイドロボットのloco-manipulationをトレーニングするためのデジタルデータ生成パイプライン。

mozilla-ai/cq

AIエージェントが構造化された知識を保存・取得し、同じ間違いを繰り返すのを防ぐための、共有エージェント学習のためのオープンスタンダード。

arcships/light-ocr

Node.js および C++ 向けの高速でオフラインの OCR ライブラリ。画像および PDF のローカルテキスト認識を、組み込みのハードウェアアクセラレーションで実現。

Notely-Voice/NotelyVoice

OpenAI Whisper を使用してオフラインの音声文字起こし機能を提供する、プライベートでクロスプラットフォームの AI 音声文字起こし・メモアプリです。

tdrussell/diffusion-pipe

複数のGPUを使用して、大規模な画像およびビデオ拡散モデルのトレーニングを可能にするパイプライン並列トレーニングスクリプト。

AI-Hypercomputer/maxtext

Google Cloud TPUsおよびGPU上で大規模モデルの事前学習および事後学習を行うための、JAXおよびPythonで記述された高パフォーマンスでスケーラブルなLLMライブラリ。

google/XNNPACK

XNNPACK は、ARM、x86、WebAssembly、RISC‑V プラットフォーム上でニューラルネットワーク推論を高速化するための、極めて最適化された低レベルパフォーマンスプリミティブライブラリです。

modelcontextprotocol/php-sdk

Model Context Protocol (MCP) の公式PHP SDKで、PHPのツールやリソースをAIモデルに公開するためのMCPサーバーとクライアントを構築できます。

callstackincubator/agent-skills

AI コーディングアシスタントにインストールして、アプリの最適化、テスト、移行を支援するための、専門的な React Native 知識バンドルのコレクションです。

workos/auth.md

AIエージェントがユーザーの代わりにサービスに認証するためのエージェント登録プロトコルの参照実装。身元証明とクレーム儀式を通じて、ユーザーの代わりにサービスに認証を可能にする。

ucb-bar/chipyard

ChiselベースのRISC-Vシステムオンチップのアジャイル開発を支援するオープンソースフレームワーク。プロセッサコア、アクセラレータ、VLSIツールを統合しています。

LeslieLeung/glean

大量の情報を扱うユーザーが、知能的な集約とベクトルデータベースを活用して、高負荷の読書を管理できる自己ホスト型RSSリーダーおよび個人知識管理ツール

luwill/research-skills

学術研究ワークフローを自動化するために設計されたClaude Codeスキルのコレクション。網羅的な文献検索、検証済みの計画書作成、および高精度なスライド生成を含みます。

ards-project/ard-spec

ネットワーク間でMCPサーバー、スキル、APIなどのエージェントリソースをカタログ化および発見するための、フェデレーテッドでドメインアンカー型の仕様。

huggingface/transformers.js

ONNX Runtime を使用して、サーバーを必要とせずに事前学習済みの機械学習モデルをブラウザ内で直接実行できる JavaScript ライブラリ。

DeepLabCut/DeepLabCut

DeepLabCutは、ディープラーニングを使用して、物理的なマーカーを付けることなくビデオ内の動物や物体を追跡できる、マーカーレス姿勢推定ツールボックスです。

zsibot/matrix

Unreal Engine 5とMuJoCoを組み合わせた高精度ロボットシミュレーションプラットフォーム。リアルなレンダリング、高レート物理、ROS 2互換のデータストリーミングを提供します。

elevenlabs/skills

ElevenLabsの音声、音声変換、吹き替え、および音楽生成APIを公開する、すぐに利用可能な「agent skills」のセットです。`npx skills add elevenlabs/skills`でインストールし、APIキーを設定すれば、互換性のあるあらゆるAIコーディングアシスタント(例:text-to-speech, speech-to-text, real-time voice chat, voice-changer, dubbing)からスキルを呼び出すことができます。リポジトリにはPython, JS/TS, および CLI SDKが提供されており、さらにトリガーおよび機能検証用のテストスイートも含まれています。MITライセンスです。

hjanuschka/pi-multi-pass

pi コーディングエージェント用のマルチサブスクリプション拡張機能で、複数の AI プロバイダーアカウント間で自動レート制限ローテーションとフェイルオーバーを実現します。

kennyzir/7deer_skills

AIエージェントが7段階のエビデンスに基づいたパイプラインを通じて、Robloxゲームウェブサイトを調査、計画、および成長させるための、構成可能で監査可能なワークフロー。

martin-ger/esp32_nat_router

ESP32をWiFi NATルーターに変換するファームウェア。WireGuard VPN、WPA2-Enterprise対応、AI制御可能なネットワーク管理用MCPブリッジを搭載。

enactic/openarm_hardware

ロボットアームの構築とカスタマイズに必要なCADファイル、BOM、組立ガイドを提供するオープンソースハードウェアプラットフォーム。

lucasygu/redbook

ブラウザクッキー認証を使用して、キーワードリサーチ、バズコンテンツ分析、自動エンゲージメント管理を実行するXiaohongshu用のコマンドラインツール。

aikohanasaki/SillyTavern-MemoryBooks

SillyTavernの拡張機能で、チャット履歴を構造化されたロアブックエントリに変換し、長期記憶と物語の連続性を維持します。

ricky0123/vad

ユーザーの会話を含む音声セグメントでコールバックを実行できる JavaScript ライブラリです。

Chestnut-Robotics/aero-hand-open

手頃な価格のオープンソースで3Dプリント可能な腱駆動ロボットハンド。繊細な操作学習と強化学習の研究に最適です。

PrismML-Eng/Bonsai-Image-Demo

Apple Silicon、Linux、Windows向けのクロスプラットフォームデモ。4 BパラメータのBonsaiディフュージョンモデル用に、macOS(MLX)またはNVIDIA GPU(gemlite + HQQ)上でWebベーススタジオとCLIによる画像生成を提供。

kyutai-labs/hibiki

Hibikiは、ユーザーが話す途中で自然なターゲット音声とテキストをリアルタイムに生成するストリーミング音声-to音声翻訳モデルです。

jtydhr88/ComfyUI-qwenmultiangle

ComfyUI用のカスタムノードで、Qwen-Image-Edit-2511-Multiple-Angles-LoRAと互換性のあるプロンプトを生成するためのインタラクティブな3Dビューポートを提供します。

neo4j-contrib/mcp-neo4j

LLMがNeo4jデータベースを照会し、Auraクラウドインスタンスを管理し、永続的な知識グラフ記憶を維持できるようにするModel Context Protocol (MCP) サーバーのコレクションです。

monarch-initiative/ontogpt

LLMを使用してテキストから構造化された、オントロジーに基づく情報を抽出するためのPythonパッケージ。識別子を現実世界のオントロジーと照合することで、幻覚を防止します。

oomol-lab/epub-translator

AI駆動のツールで、EPUB書籍を二語版に変換し、元のフォーマットと構造を保持しながら、並べて読める翻訳を提供します。

liu00222/Open-Prompt-Injection

汚染されたプロンプトの検出と局所化に特化した、プロンプトインジェクション攻撃と防御の実装・評価に使えるオープンソースのツールキット。

Windecay/ComfyUI-ReservedVRAM

OOMエラーを防ぎ、GPUメモリ使用量を最適化するために、予約されたVRAMをリアルタイムで動的に調整するComfyUIノード。

mcpware/cross-code-organizer

AIコーディングツール用のクロスハーネス設定オーガナイザーで、メモリ、スキル、MCPサーバーを管理する統合ダッシュボードを提供し、トークン使用量を最適化し、ツールポイズニングを検出します。

ok-helloworld/vibe-pentest

WebアプリケーションとAPI全体で脆弱性を発見する際に、人間のセキュリティ専門家をシミュレートするマルチエージェントアーキテクチャを使用するAI駆動のペネトレーションテストツール。

TencentARC/Track4World

Track4Worldは、単眼動画におけるすべてのピクセルの高密度3D追跡を可能にするフレームワークであり、フィードフォワード方式でワールドセントリックな3Dシーンフローを推定します。

hamishivi/tmax

Tmaxは、合成データ生成パイプラインと専用の訓練レシピを備えた、端末を使用するAIエージェントの訓練と評価のためのフレームワークです。

UVA-Computer-Vision-Lab/OmniShotCut

多様な動画ソース間でカットやトランジションを識別する高パフォーマンスなショット境界検出ツール。Shot-Query Transformer を使用。

saddam213/AmuseAI

さまざまなオープンソースパイプラインとGPUバックエンドを使用して、画像、動画、音声、テキストの生成と編集を行うローカルマルチモーダルAIアプリケーション。

lencx/Noi

Noiは、プロンプト管理、セッションの隔離、組み込みターミナルを通じて、AIチャットワークフローをスムーズにするインタラクション最優先のワークスペースおよびブラウザです。

kigner/audio.cpp-webui

ggmlに基づいた高性能なC++オーディオ推論フレームワーク。TTS、ASR、ボイスクローニングモデルの高速かつポータブルなローカル実行を、複数のハードウェアバックエンドで実現します。

VigoZhao/AI-Visual-Prompt-Cookbook

130以上のJSONベースのビジュアルスタイルプロンプトテンプレートを収録したキュレート済みライブラリ。各 `style.json` は、再利用可能なレイアウト(例:ポスター、コラージュ、タイポグラフィアート)を定義し、プレースホルダを事前に埋めてからマルチモーダルLLM(ChatGPT‑4‑Vision、Gemini‑3‑Proなど)に貼り付けることで使用可能。リポジトリにはプレビュー画像、例値、検証スクリプト、コピー・プロンプトショートカットが含まれ、AI生成グラフィックの一貫性と反復作業のしやすさを実現する。

SAIL-Research-Lab/cheetahclaws

任意のLLM(ローカルモデルを含む)をサポートする、Pythonネイティブのエージェントハッチで、Claude Codeなどのプロプライエタリツールの柔軟でオープンソースな代替を提供します。

skyzh/vector-db-from-scratch

Arrowテーブル、DataFusion統合、および複数のANNインデックス(IVFFlat、NSW、HNSW、IVF-PQ)をカバーする、Rustベースの段階的コース。SQLサポートとベンチマークツール付き。

OrRon/EpicInfographics

AIエージェント向けのスキルであり、汎用的なテンプレートをシーンベースのデザインと数学的な正確さに置き換えることで、プロフェッショナルなスタジオ品質のインフォグラフィックとアニメーションの作成を可能にします。

kunchenguid/vision

リポジトリの履歴を分析して、検証可能な `VISION.md` ファイルを作成するエージェントスキル。プロジェクトの機能や貢献に対する具体的な受入基準として機能する。

Fannovel16/comfyui_controlnet_aux

深度マップ、Canny エッジ、人間のポーズなど、ControlNet のヒント画像を生成するためのプリプロセッサを提供する ComfyUI ノードのコレクションです。