imagej/imagej2
ImageJ2は、多次元画像データへの対応と、複数のプログラミング言語にわたるヘッドレス処理をサポートするために、オリジナルのImageJを拡張した科学画像フレームワークです。
unrealcv/unrealcv
コンピュータビジョン研究者が仮想世界を構築し、PyTorch や TensorFlow といった外部のAIフレームワークを使用してそれらと対話できるようにする Unreal Engine 用のプラグイン。
microsoft/Cognitive-Samples-VideoFrameAnalysis
Microsoft Cognitive Services Vision APIを使用して、ウェブカメラの動画フレームをほぼリアルタイムで解析するためのC#ライブラリとサンプルアプリケーション。
zhanghang1989/PyTorch-Encoding
画像分類とセマンティックセグメンテーションのための高度なエンコーディングモジュールとモデルズーを提供します。
apple-aiml-research/ml-aim
マルチモーダル理解および画像認識に高パフォーマンスを発揮する大規模自己回帰型ビジョンエンコーダーのファミリーです。
hzxie/GaussianCity
GaussianCityは、Gaussian Splattingを使用して無制限の大規模な都市環境を作成する生成型3D都市合成ツールです。
HarborYuan/ovsam
数千の物体クラスの同時インタラクティブセグメンテーションとオープンボリューム認識を可能にする、Segment Anything Model (SAM) のオープンボリューム拡張版。
hzxie/CityDreamer
CityDreamerは、レイアウト生成器、背景要素生成器、建物インスタンス生成器を組み合わせることで、無制限かつ写実的な3D都市景観を生成する研究用PyTorchフレームワークです。大規模なOSM/GoogleEarthデータセットでのトレーニングコード、事前学習済みチェックポイント、Webデモ、および動画レンダリング用CLIを含んでいます。
cvg/DeepLSD
DeepLSDは、深層学習と画像勾配を組み合わせて、現実世界の画像から線分を抽出・精緻化する高精度な線分検出器です。
VCIP-RGBD/DFormer
DFormerは、RGB‑Dセマンティックセグメンテーションの研究用コードベースで、DFormer、DFormerv2(ジオメトリーガイド付きアテンション)およびDFormer++(効率的で高精度なバリエーション)を実装しています。事前学習スクリプト、データセットヘルパー、学習/評価パイプライン、およびNYU‑Depth v2およびSUN‑RGBD用の事前学習済み重みを含みます。このリポジトリは本格的なAI/MLプロジェクトです。
ria-com/nomeroff-net
YOLOv8とRNNベースのOCRを使用して、複数国にわたるナンバープレートの検出と読み取りを行うオープンソースのPythonフレームワークです。
google-ar/arcore-unity-extensions
UnityのAR Foundationに対して、Google ARCoreの拡張現実(AR)機能へのネイティブAPIアクセスを提供する拡張機能セットです。
QuinnDamerell/OctoPrint-OctoEverywhere
AI駆動の印刷失敗検出機能を備えた、3Dプリンター向けのリモートアクセスおよび監視サービス。失敗した印刷を自動停止します。
half-potato/radiance_meshes
Radiance Meshes 用のトレーニングフレームワーク。画像から 3D シーンのボリューム再構成を可能にし、モバイル Web での閲覧用にモデルを最適化するオプションを備えています。
tensorflow/graphics
『合成による解析』を用いて3Dビジョンモデルの自己教師あり学習を可能にする、TensorFlow向けの微分可能なグラフィックスおよび幾何学レイヤーのライブラリ。
HasnainRaz/Fast-SRGAN
SR-GANに基づくリアルタイムのスーパーレゾリューション実装で、ピクセルシャッフルを活用して低解像度動画を高解像度に効率的にアップスケールします。
levyflux/AViD
AViDは、LoRAとEMAを用いた微調整フレームワークであり、オープンボリュームオブジェクト検出器であるGrounding DINOをカスタムデータセットに効率的に適応可能にします。
lartpang/SAMs-CDConcepts-Eval
画像やビデオを通じて、医療用の病変や工業製品の欠陥などの文脈依存型の概念をセグメント化する SAM と SAM 2 の能力をテストするための包括的な評価フレームワーク。
Luo-Yihao/FaithC
SDFとMarching Cubesを置き換える、鋭いエッジと内部構造を保持する近似損失なしの3Dボクセル表現システム。Faithful Contour Tokens (FCTs) を用いて実現。
google-ar/arcore-ios-sdk
GoogleのクロスプラットフォームARCore機能(Cloud AnchorsやGeospatial APIなど)をiOSアプリケーションに導入するソフトウェア開発キットです。
arthurflor23/handwritten-text-recognition
TensorFlowベースのフレームワークで、広範なデータ増強と複数の標準HTRデータセットをサポートする手書きテキスト認識および合成技術を提供。
openMVG/openMVG
画像(写真測量)からの3D再構成のためのC++フレームワークで、構造から運動問題を解決するためのライブラリとパイプラインを提供します。
argoverse/argoverse-api
自律走行研究用に、HDマップ、3Dトラッキングデータ、運動予測シーケンスにアクセスするためのPython APIです。
ShenhanQian/VHAP
VHAPは、単眼およびマルチビュー動画において、髪や耳などランドマークのない領域を適応的外観事前知識を用いて追跡するための光度最適化パイプラインです。
lartpang/PySODMetrics
Matlabベースの評価ツールボックスの代わりに、高速かつ検証可能な方法で顕著対象検出(SOD)メトリクスを計算する軽量なPythonライブラリ。
naruya/gaussian-vrm
Web、モバイル、VRアプリケーションでリアルでアニメーション可能な3Dキャラクターをレンダリングできる、インスタントスキン付きガウシアンアバターの three.js 実装です。
worldcoin/open-iris
コンピュータビジョンと機械学習を活用した、安全なバイオメトリック認証および大規模な独自性確認を実現する高度な虹彩認識パイプライン。
MrGiovanni/SyntheticTumors
AIセグメンテーションモデルの訓練に必要な手動ラベル付き医療画像データへの依存を減らすための、現実的な合成腫瘍を生成するためのフレームワーク。
MrGiovanni/AbdomenAtlas
人間とAIを組み合わせたアプローチにより、腹部セグメンテーションのための大規模な多臓器CTデータセットとツールセットを提供し、アノテーション時間を数十年から数週間に短縮する。
foo123/FILTER.js
WebGL、WebAssembly、Web Workers を通じたハードウェアアクセラレーションをサポートする、純粋な JavaScript による画像・動画処理およびコンピュータビジョン用ライブラリ。
Unity-Technologies/arfoundation-samples
AR Foundationを使用して、複数プラットフォームの拡張現実機能を実装するための公式Unityサンプルシーンとコードのコレクション。
pyushkevich/itksnap
ITK-SNAPは、医用画像における解剖学的構造のユーザー主導3Dアクティブコンタウアセグメンテーションを行うためのオープンソースソフトウェアアプリケーションです。
tudelft-iv/view-of-delft-dataset
都市交通における道路利用者の検出と追跡のための、同期されたLiDAR、カメラ、3+1Dレーダーのデータと、3Dバウンディングボックスのラベルを備えたマルチセンサー自動車データセット。
dstndstn/astrometry.net
Astrometry.net は、スカイの位置が不明な画像に対して、天体座標と補正メタデータを自動的に提供するツールです。
ducha-aiki/pydegensac
スパースな画像対応関係からホモグラフィー行列および基本行列を推定するための Python ラッパー(LO-RANSAC および DEGENSAC を使用)
mapillary/OpenSfM
Pythonで作られた構造から運動(SfM)ライブラリで、複数の画像から3Dシーンとカメラポーズを再構成し、センサー情報を統合して地理的位置に一致させる。
bcmi/Image-Harmonization-Dataset-iHarmony4
iHarmony4 という大規模な画像調和データセットと、DoveNet の PyTorch 実装を提供し、合成画像に挿入されたオブジェクトが自然に見えるようにするモデルの開発を支援します。
Pointcept/Concerto
3D ポイントクラウドから高品質な空間表現を抽出するための、2D-3D 連合自己教師付き事前学習された Point Transformer V3 モデル。
hanna-xu/U2Fusion
ラベル付き訓練データを必要とせずに、マルチモーダル、多重露光、およびマルチフォーカス画像を1枚の高品質な画像に統合する、統合された教師なし画像融合ネットワーク。
IvanDrokin/torch-conv-kan
TorchConv‑KAN は、各カーネルが学習可能な一変数関数(KAN、Fast‑KAN、Cheby‑KAN など)のセットである畳み込み層を実装する PyTorch ライブラリです。多数のレイヤー変種、CNN スタイルのモデルファミリー(ResKANet、DenseKANet、VGG‑KAN、U‑Net‑KAN)、事前学習済み ImageNet‑1k チェックポイント、および Accelerate、Hydra、WandB、Ray‑Tune を使用するトレーニングスクリプトを備えています。プロジェクトは現在積極的に開発中であり、コルモゴロフ・アルノルド畳み込みに関する研究論文と併せて提供されています。
MIC-DKFZ/nnDetection
医療画像内の物体の局所化と分類を同時に行うための自己設定フレームワーク。設定プロセスを自動化し、任意の医療検出問題に適応します。
Mark12Ding/SAM2Long
SAM2Long は、誤差の蓄積を防ぎ、長時間動画におけるオブジェクトセグメンテーションを向上させるための、トレーニング不要な SAM 2 の強化手法です。
Altaheri/EEG-ATCNet
脳-コンピュータインターフェースを改善するために、運動想起EEG信号を分類するためのAttention Temporal Convolutional Network (ATCNet) の TensorFlow 実装。
Sompote/DINOV3-YOLOV12
YOLOv12とDINOv3を組み合わせたハイブリッド物体検出フレームワークで、特に小規模または複雑なデータセットにおいて優れた精度と高速な収束を実現。
schappim/macOCR
AppleのVisionフレームワークを使用して、画面、画像、またはPDFからテキスト、QRコード、バーコードを抽出するmacOS用のコマンドラインOCRツール。
EyeTrackVR/EyeTrackVR
OSCおよびUDPプロトコルを介してVRChatで眼追跡を可能にする、オープンソースで手頃な価格のVR眼追跡プラットフォーム。
nipy/nipype
Pythonプロジェクトで、神経画像処理ソフトウェアへの一貫したインターフェースを提供し、異なるパッケージのツールを統合して単一の再現可能なワークフローを構築できるようにします。
gallantlab/pycortex
Pycortex は、皮質表面に fMRI およびその他の体積型神経画像データを可視化するためのソフトウェアライブラリです。