insight-platform/Savant
Nvidia ハードウェア上でリアルタイムかつ高性能なコンピュータビジョン・ビデオ分析パイプラインを構築するためのハイレベルフレームワークで、DeepStream の複雑さを抽象化します。
luispedro/mahotas
C++ で実装された高速な Python コンピュータビジョンライブラリで、NumPy 配列上で動作する 100 以上の画像処理アルゴリズムを提供します。
FORTH-ModelBasedTracker/MocapNET
リアルタイムの2D‑to‑3Dヒューマンポーズ推定器で、RGBビデオフィードを標準BVHモーションキャプチャファイルに変換し、3Dアニメーションに利用できます。
imagej/imagej2
ImageJ2は、多次元画像データへの対応と、複数のプログラミング言語にわたるヘッドレス処理をサポートするために、オリジナルのImageJを拡張した科学画像フレームワークです。
IliasHad/edit-mind
ローカルの動画ナレッジベースで、文字起こしとビジュアル分析により動画をインデックス化し、自然言語で動画コンテンツを意味的に検索できるようにします。
opendatacam/opendatacam
オープンソースのコンピュータビジョンツールで、ビデオフィード内の移動物体を検出・追跡・カウントし、実世界の動きを定量化します。主に交通調査で使用されます。
MRPT/mrpt
SLAM、ナビゲーション、マッピング、センサー統合に必要なツールを提供する、堅牢でモジュール化されたモバイルロボティクス用C++フレームワーク。
ARM-software/ComputeLibrary
Arm Cortex-A、Neoverse、Mali GPU アーキテクチャ向けに最適化された低レベル機械学習関数のコレクションで、高性能な ML 推論を提供します。
shimat/opencvsharp
C#開発者に包括的なコンピュータビジョンおよび画像処理機能を提供する、OpenCVのクロスプラットフォーム.NET ラッパー。
deepgram/deepgram-python-sdk
自動音声認識、音声合成、言語理解APIを簡単に統合できるDeepgramの公式Python SDK。
vargHQ/sdk
オープンソースの TypeScript SDK で、開発者や AI エージェントが宣言的 JSX 構文と統一 API を使って複数の AI プロバイダー向けに AI 生成動画を作成できます。
sdv-dev/SDGym
合成データのモデリングと生成をベンチマークするフレームワークで、ユーザーはさまざまな機械学習手法のパフォーマンス、メモリ使用量、品質を比較できます。
digital-go-jp/genai-ai-api
日本のデジタル庁が、政府職員が特定のタスクに特化した AI アプリケーションをデプロイするために開発した、生成 AI マイクロサービスとクラウドテンプレートのコレクションです。
inseq-team/inseq
シーケンス生成モデルの事後解釈性のための PyTorch ベースのツールキットで、モデル出力を説明するさまざまな特徴帰属手法を提供します。
aws-samples/bedrock-engineer
Amazon Bedrock によって駆動される自律的なソフトウェア開発エージェントアプリで、ファイルの作成、コマンドの実行、カスタマイズ可能なエージェントインターフェースを通じたプロジェクト管理が可能です。
aws-samples/well-architected-iac-analyzer
Infrastructure as Code (IaC) とアーキテクチャ図を AWS Well-Architected ベストプラクティスに対して分析し、優先順位付けされた是正提案を提供する AI 駆動型ツール。
eidolon-ai/eidolon
組み込み HTTP サーバーと動的エージェント間通信を備えた、モジュール化・スケーラブルなサービスとして AI エージェントを構築・デプロイするためのオープンソース SDK。
GoogleCloudPlatform/genai-for-marketing
Google Cloud 上のソリューションで、Vertex AI と Google Workspace の統合により、マーケティングコンテンツの自動生成、トレンド分析、データクエリを実現します。
digital-go-jp/genai-web
...
nv-tlabs/XCube
XCubeは、階層的潜在拡散とVDBデータ構造を使用して、詳細な3Dオブジェクトと大規模なシーンを作成する、高解像度疎な3Dボクセルグリッド用の生成モデルです。
alexiglad/EBT
テキスト、画像、動画の各モダリティでスケーラブルな推論と System 2 思考を可能にする、エネルギーベーストランスフォーマー(EBT)用フレームワークです。
FoundationVision/Liquid
Liquid は、外部の視覚埋め込みを必要とせず、視覚理解と画像生成を単一の LLM に統合した統一的な自己回帰マルチモーダルジェネレータです。
sdv-dev/Copulas
コピュラ関数を使用して多変量分布をモデル化し、合成数値データを生成するための Python ライブラリ。
SomeOddCodeGuy/WilmerAI
高度な意味的プロンプトルーティングとマルチLLMオーケストレーションを可能にするノードベースのワークフローエンジンで、ユーザーが複雑で文脈に応じたAIエージェントを作成できるようにします。
Azure-Samples/serverless-chat-langchainjs
LangChain.js と Azure を使用したサーバーレス AI チャットボット実装で、RAG(Retrieval‑Augmented Generation)を有効にし、企業ドキュメントに基づく問い合わせに回答します。
jdh-algo/JoyVASA
JoyVASA は diffusion ベースのフレームワークで、音声を用いて人間や動物のポートレートをアニメーション化し、顔のアイデンティティと動きを分離して高品質かつ長尺の動画生成を可能にします。
Coframe/coffee
AI 駆動のフロントエンドエンジンで、開発者は IDE 内で特別な JSX コンポーネントとプロップを使用して React コンポーネントを生成、反復、洗練できます。
LLPhant/LLPhant
Generative AI とベクトルデータベース用の PHP ライブラリ。LLM とベクトルストアを PHP アプリケーションに統合するための統一インターフェースを提供します。
alan-ai/alan-sdk-web
Web アプリケーションにインテリジェント層を埋め込み、ビジネスロジックと UI コンポーネントをリアルタイムで生成できる SDK。
nxnai/Voost
Voost は統合された Diffusion Transformer で、高品質な双方向バーチャルトライオン・トライオフを実現し、人物画像に服を追加したり除去したりできます。
quantgirluk/aleatory
一次元および二次元のさまざまな確率過程をシミュレートし可視化するための Python ライブラリです。
Ammmob/PixelSmile
PixelSmile は、人物やアニメキャラクターの画像において、本人のアイデンティティを保ちつつ感情を変更できる、細かい顔表情編集ツールです。
Visionary-Laboratory/visionary
WebGPUを活用し、ONNX Runtimeを使用してブラウザ上でGaussian Splattingのバリエーションと3Dメッシュをリアルタイムでレンダリングするプラットフォーム。
WHU-USI3DV/VistaDream
VistaDream は、生成された新しいビュー間の一貫性を確保することで、単一ビュー画像から高品質な 3D シーンを再構築するトレーニング不要フレームワークです。
EzioBy/Ditto
Ditto is a framework for generating high-quality synthetic video editing data to train Editto, a state-of-the-art instruction-based video editing model.
thu-ml/DiT-Extrapolation
位置エンコーディングの外推によって、より長い動画や高解像度の画像を生成可能にする、Diffusion Transformers 用のプラグアンドプレイ・フレームワーク。
PKU-YuanGroup/ConsisID
ConsisID は、チューニング不要で DiT ベースのテキストから動画への生成モデルで、周波数分解を用いて生成された動画フレーム間で一貫した人物のアイデンティティを保ちます。
UCSC-VLAA/story-iter
トレーニング不要の反復フレームワークで、最大 100 フレームにわたる長編ストーリーの可視化において、グローバルリファレンスクロスアテンションモジュールを用いて意味的一貫性を保ちます。
haidog-yaqub/MeanFlow
A PyTorch implementation of Mean Flows and Improved Mean Flows for high-quality, one-step image generation.
PKU-YuanGroup/MagicTime
MagicTime は、テキストプロンプトに基づいて現実的なタイムラプス動画を生成し、顕著な物理的変化を描写するメタモルフィック動画生成パイプラインです。
DaoyuanLi2816/can-i-finetune-this
コンシューマー向けGPUでLoRAおよびQLoRAを使用してLLMをファインチューニングする際の、VRAM使用量の推定、パフォーマンスのベンチマーク、およびトレーニングレシピの生成を行うCLIツール。
nolabs-ai/deepfabric
実際のツール実行とトピックグラフマッピングを使用して、エージェント型LLMのための高品質なトレーニングデータセットを作成する、合成データ生成および評価フレームワーク。
open-edge-platform/geti_v2
Getiは、スマートなデータアノテーションやアクティブラーニングから、モデルのトレーニング、エッジへのデプロイまで、AIライフサイクル全体を合理化するエンドツーエンドのコンピュータビジョンプラットフォームです。
kaito-project/aikit
コンテナ化されたイメージとOpenAI互換APIを用いた、LLMのホスティング、デプロイ、ファインチューニングを一元的にサポートする包括的プラットフォーム。
Koldim2001/YOLO-Patch-Based-Inference
YOLO モデル向けにパッチベース推論を可能にし、画像タイル化と結果統合により大きな画像中の小さな物体検出を改善する Python ライブラリです。
zhiqwang/yolort
YOLOv5 用のランタイムスタックで、前処理と後処理をモデルグラフに埋め込むことで、さまざまなハードウェアアクセラレータでの物体検出のデプロイを簡法化します。
run-house/kubetorch
Pythonic なサーバーレスインターフェースで、ML 開発者がローカル環境から直接 Kubernetes クラスタ上でワークロードを実行・スケールでき、起動時間はほぼ即時です。
facebookincubator/nimble
Metaによって設計された、大規模かつワイドなデータセット向けに最適化された列指向ファイル形式。機械学習のトレーニングテーブルや特徴量エンジニアリングのストレージとアクセスの最適化を実現します。