dropbox/gemlite
効率的な低ビット行列乗算のためのTritonカーネルのコレクションで、LLMのプリフェイルおよびデコードのパフォーマンスを向上させます。
OpenDriveLab/WorldEngine
WorldEngine は、実際のログから稀で安全上重要なシナリオを自動的に発見し、写実的な3Dガウススプラッティングで再構築し、生成されたシミュレーション結果上で強化学習(RL)を用いてドライブモデルを微調整するオープンソースのトレーニング後処理プラットフォームです。SimEngine(クローズドループシミュレーション)とAlgEngine(トレーニング/評価)の2つのサブシステムを備え、稀なケースベンチマークで大幅な向上を達成し、実世界でのデプロイではゼロのエンゲージメントを実現しています。
cre185/InstantSfM
2D画像から3D構造を再構成するプロセスを加速するGPUネイティブな構造から運動(SfM)パイプラインで、3Dガウススプラッティングの統合サポートも提供しています。
cohere-ai/cohere-python
Cohere Python SDKは、AWS、Azure、GCP、Oracle OCIを含むさまざまなプラットフォーム上でCohereのAIモデルにアクセスできるクライアントライブラリです。
poolsideai/pool
さまざまなLLMプロバイダーに対応する、ターミナル、ACP経由のIDEプラグイン、または非対話モードで実行可能な汎用的なコーディングエージェント。AIがコードベースの変更計画と実行を自動化できる。
NVIDIA/makani
100台以上のGPUにわたるスケーリングをサポートする、機械学習ベースの気象・気候モデルのマスively parallelな学習および推論を実現するPyTorchライブラリ。
fishaudio/audio-preprocess
AI学習用データセットの準備に役立つ、ボーカル分離、音量一致、音声認識などの音声処理スクリプトのコレクションです。
chalk-lab/Mooncake.jl
Julia 向けの変異をサポートし、最適化された中間表現を活用して効率的な微分計算を行う高性能な自動微分パッケージ。
ilastik/ilastik
細胞やその他の実験画像データのセグメンテーション、分類、トラッキング、カウントを行うためのインタラクティブな機械学習ツールキット。
pzqpzq/LSF_MDia
MDia は、LLM の中間推論を再利用可能な「方言カード」(LSF)として形式化する Python ライブラリであり、生成・進化・プロファイリング・ルーティング・監査を実施する決定論的8段階パイプライン(collect → create → evolve → profile → select → run → validate-rules → report)を提供します。ブラックボックス LLM API をサポートし、複数のルーティング計画を備え、100ルールのバンクを含み、テスト評価前に意思決定を固定することで再現性を保証します。リポジトリには API キー不要のトゥイオフラインデモ、豊富なドキュメント、MITライセンス、ICML 2026ポスターおよびarXiv論文への引用が含まれます。
MINT-SJTU/Evo-1
Evo-1 はロボット操作のための軽量な Vision-Language-Action (VLA) モデルであり、視覚とテキストの指示をロボットのアクションに変換し、様々なシミュレーションと実際のハードウェアで動作します。
linus-sch/Mind-Map-Wizard
LLM と独自の SVG レンダリングエンジンを使用して、トピックやファイルをインタラクティブで視覚的なマインドマップに変換する AI ベースのツール。
NEKOparapa/ReaDreamAI
テキスト生成、一貫したキャラクターイラスト、動画アダプテーションを自動化するAI駆動のプラットフォーム。
pyt-team/TopoModelX
単体複体などのトポロジカルドメインにおけるディープラーニングを可能にするPythonモジュール。科学および工学分野での応用に適しています。
Ammaar-Alam/minebench
MineBenchは、『中世の城』のようなプロンプトに対してボクセル座標を出力させる仕組みで、LLMの3次元空間推論能力を評価するウェブベースのベンチマークです。生成物を可視化し、人間による直接比較を可能にし、ブレイディ・テリー法でモデルをランク付けします。プラットフォームには、ペアワイズ投票用のArena、カスタム構築用のSandbox、コミュニティプロンプトのGallery、およびGLB、STL、.vox、.schem形式でのエクスポート機能を備えています。主要なLLMプロバイダーをサポートし、Node.js、pnpm、Dockerでローカル実行も可能です。
Jasonzzt/ComfyUI-CacheDiT
Diffusion Transformer (DiT) モデルの生成を知能的キャッシュによって加速する ComfyUI 拡張機能。画像および動画生成において、1.4x から 2.0x の高速化を実現。
onyx-dot-app/onyx-foss
Onyxは、LLMのためのアプリケーションレイヤーとして機能するオープンソースAIプラットフォームであり、エージェントRAG、ディープリサーチ、カスタムエージェントなどの高度な機能を提供します。
supermemoryai/memorybench
標準化されたデータセットと判断モデルを使用して、異なるプロバイダー間で AI メモリおよびコンテキストシステムを評価・比較するためのプラグイン式ベンチマークフレームワークです。
runpod/runpod-python
RunPod 公式 Python ライブラリ。サーバーレス AI ワーカーを作成するための SDK と、GPU クラウドポッドおよびエンドポイントを管理するための REST API ラッパーを提供します。
PackmindHub/packmind
複数の AI コーディングエージェントとリポジトリ間でコーディング標準と指示を同期する中央集権的なエンジニアリングプレイブック。
microsoft/ai-dev-gallery
Windows開発者がローカルAIモデルを探索し、それらをC# Visual Studioプロジェクトとしてエクスポートできる、インタラクティブなAIサンプルギャラリー。
vitoplantamura/OnnxStream
メモリ最適化された推論ライブラリ。Stable Diffusion や LLM などの大規模AIモデルを、超低RAMデバイスで実行可能にするために、重みのストリーミングとアテンションスライシングを活用。
UWMILab/UniWM
UniWMは、エゴセントリックな視覚的予測と計画を1つのマルチモーダル自己回帰バックボーンに統合する、メモリ拡張型の統合世界モデルであり、視覚ナビゲーションに適しています。
microsoft/LatentSpatialMemory
3Dシーンの内容を潜在トークンとして保存し、RGBレンダリングの繰り返しを回避することで生成速度を向上させ、メモリオーバーヘッドを削減するビデオワールドモデル用のフレームワーク。
Ma-Zhuang/OmniNWM
OmniNWMは、自律走行シミュレーション用のパノラマ型マルチモーダルワールドモデルを構築する研究用コードベースです。車両の軌道からRGB、セマンティック、深度、3次元占有グリッドを一括生成し、正規化Plückerレイマップで正確な制御を実現。占有に基づく密な報酬によりクローズドループポリシー評価が可能。リポジトリには、transformersの手動パッチを含むインストール手順、nuScenes用データ準備手順、事前学習済みチェックポイントのダウンロードリンク、推論・分布外テスト・段階的学習用スクリプトが含まれます。
TencentARC/VerseCrafter
VerseCrafterは、4D幾何制御とGeoAdapterを使用して、現実的な動画におけるカメラと複数オブジェクトの動きに対して、正確かつ解釈可能な制御を提供する制御可能な動画ワールドモデルです。
nvidia-cosmos/cosmos-predict1
将来の状態予測に特化した世界基盤モデル(WFMs)のスイート。テキストまたは動画プロンプトから視覚的シミュレーションを生成し、Physical AI の開発を支援します。
Tencent-Hunyuan/HY-WorldPlay
HY-World 1.5 は、ユーザー入力に基づいて幾何学的に一貫した3D環境をストリーミング動画拡散によってリアルタイムで生成するインタラクティブな世界モデリングフレームワークです。
jamubc/gemini-mcp-tool
AIアシスタントをGemini/Antigravity CLIに接続するMCPサーバーで、大規模なコードベース分析とサンドボックス化されたコード実行を可能にします。
justrach/kuri
AIエージェント向けの軽量なブラウザ自動化ツール。単一のZigバイナリとして実装されており、Node.jsへの依存関係はありません。
0xranx/golembot
GolemBot は、既存のコーディングエージェント(Cursor, Claude Code, OpenCode, Codex)にチャットボットの「本体」を与える Node.js ランタイムです。単一の `golembot gateway` コマンドで、Slack、Telegram、Discord、Feishu、DingTalk、WeCom、WeChat、またはカスタム HTTP API 上でエージェントを公開し、小さな YAML 設定で LLM プロバイダー(OpenRouter、MiniMax、DeepSeek など)を切り替えることができます。ClawHub マーケットプレイス(13k+ のコミュニティスキル)と統合されているため、エージェントはすぐに新しい能力を獲得できます。機能には組み込みダッシュボード、cron スケジューラー、フリート管理、そして最小限の JavaScript SDK(`createAssistant`)が含まれます。`npm i -g golembot` でインストールし、`golembot onboard` で設定を行い、`golembot gateway` で起動します。MIT ライセンス。
OpenEnvision/WorldFoundry
動画生成、3D/4D表現、および身体的AIにおいて、推論、アセットステージング、ベンチマーク評価を統合的に提供するオープンソースのインフラストラクチャ。
nndeploy/nndeploy
デスクトップ、モバイル、エッジデバイス間でAIモデルをデプロイするための高パフォーマンスAIデプロイフレームワーク。視覚的ワークフローを使用。
evilmartians/agent-prism
AIエージェントのトレースを可視化するためのReactコンポーネントライブラリ。複雑なJSONログを階層的な図に変換し、デバッグを容易にします。
Cranot/roam-code
roam‑code は、リモートAPI呼び出しを一切行わず、AIコードエージェントが定義、呼び出し元、テスト影響、リスク(爆発半径)を照会できるローカル静的解析CLI(およびオプションのMCPサーバー)です。プリフライトチェック、ヘルスサマリー、検証ゲート、Claude専用フックを提供し、すべてオープンソースでプライバシーを守ります。
mit-ll-responsible-ai/hydra-zen
Python ライブラリで、Hydra プロジェクトにおける手書き YAML 設定を排除し、設定可能でスケーラブルなワークフローの作成を簡素化します。
expectedparrot/edsl
計算社会科学と市場調査向けのドメイン固有言語で、AI エージェントと LLM を用いたアンケートや実験の設計・実行を可能にします。
iflytek/astron-rpa
AIエージェントとネイティブに統合されたエンタープライズグレードのオープンソースRPAデスクトップアプリ。低コードでデスクトップソフトウェアおよびウェブページの自動化を可能にし、AIエージェントとの深いつながりを実現。
aristoteleo/PantheonOS
エボラブルなマルチエージェントフレームワークで、データサイエンスを自動化・スケールし、エンドツーエンドのシングルセル生物学解析に特化しています。
microsoft/MInference
MInferenceは、動的なスパース・アテンション・パターンを活用することで、単一のA100 GPU上で最大10倍の高速化を実現し、長文脈LLMのプリフィリング(pre-filling)段階を加速します。
imagej/imagej2
ImageJ2は、多次元画像データへの対応と、複数のプログラミング言語にわたるヘッドレス処理をサポートするために、オリジナルのImageJを拡張した科学画像フレームワークです。
unrealcv/unrealcv
コンピュータビジョン研究者が仮想世界を構築し、PyTorch や TensorFlow といった外部のAIフレームワークを使用してそれらと対話できるようにする Unreal Engine 用のプラグイン。
Tencent-Hunyuan/HunyuanVideo-1.5
軽量な 8.3 億パラメータの動画生成モデルで、コンシューマー向け GPU 上で高品質なテキストから動画、画像から動画の合成を実現します。
buildingjoshbetter/TrueMemory
AI エージェント向けのローカルファースト長期記憶システムで、ユーザーの好みや事実を自動的に取得・更新し、セッション間の AI 記憶喪失を解消します。
Mohamedelrefaie/DrivAerNet
8,150件の高精度CFD自動車設計データセットとベンチマーク。空気力学的な最適化と性能予測のためのAIモデルのトレーニングに使用されます。
RobotecAI/rai
具身AI (Embodied AI) 機能の開発とデプロイのための柔軟なAIエージェントフレームワーク。生成AIを活用して、ロボットが推論、マルチモーダルなインタラクション、および複雑なタスク実行を可能にします。
giselles-ai/giselle
ビジュアルビルダーと GitHub 統合による、エージェント型ワークフローの構築と実行のためのオープンソース AI agent studio。
alexiglad/EBT
テキスト、画像、動画の各モダリティでスケーラブルな推論と System 2 思考を可能にする、エネルギーベーストランスフォーマー(EBT)用フレームワークです。