imagej/imagej2
ImageJ2 是一個科學成像框架,它擴展了原始的 ImageJ,以支援多維圖像數據以及跨多種程式語言的無頭處理。
unrealcv/unrealcv
一個為 Unreal Engine 設計的外掛程式,讓電腦視覺研究人員能利用 PyTorch 和 TensorFlow 等外部 AI 框架建立虛擬世界並與其互動。
microsoft/Cognitive-Samples-VideoFrameAnalysis
一個用於使用 Microsoft Cognitive Services Vision API 以近即時方式分析網路攝影機視頻幀的 C# 函式庫和範例應用程式。
zhanghang1989/PyTorch-Encoding
一個提供用於影像分類與語義分割的高階編碼模組與模型庫的 PyTorch 函式庫。
apple-aiml-research/ml-aim
一組為多模態理解與影像辨識提供高性能量的大型自回歸視覺編碼器。
hzxie/GaussianCity
GaussianCity 是一個生成式 3D 城市合成工具,利用高斯潑濺技術創建無邊界的大規模城市環境。
HarborYuan/ovsam
一個擴展了 Segment Anything Model (SAM) 的開放式詞彙模型,能夠同時進行互動式分割與數千種物體類別的識別
hzxie/CityDreamer
CityDreamer 是一個研究級的 PyTorch 框架,透過結合佈局生成器、背景填充生成器與建築實例生成器,可生成無限且逼真的 3D 城市景觀。包含在大型 OSM/GoogleEarth 資料集上訓練的程式碼、預訓練檢查點、Web 示範與 CLI 影片渲染功能。
cvg/DeepLSD
DeepLSD 是一種高精度線段檢測器,結合深度學習與影像梯度,從真實世界影像中提取並精煉線段。
VCIP-RGBD/DFormer
DFormer 是一個用於 RGB‑D 語意分割的研究程式碼庫,實作 DFormer、DFormerv2(幾何引導注意力)與 DFormer++(高效高準確度變體)。包含預訓練腳本、資料集助手、訓練/評估流程,以及 NYU‑Depth v2 與 SUN‑RGBD 的預訓練權重。此倉儲為真實的 AI/ML 專案。
ria-com/nomeroff-net
一個使用 YOLOv8 和基於 RNN 的 OCR 的開源 Python 框架,可跨多國自動檢測與讀取車牌。
google-ar/arcore-unity-extensions
一套為 Unity AR Foundation 提供 Google ARCore 增強現實功能的原生 API 存取擴充功能。
QuinnDamerell/OctoPrint-OctoEverywhere
一款為3D列印機提供遠端存取與監控服務的系統,包含AI驅動的列印失敗偵測功能,可自動停止失敗的列印。
half-potato/radiance_meshes
一個用於 Radiance Meshes 的訓練框架,可從影像資料集實現 3D 場景的體積重建,並提供針對行動網頁檢視優化模型的選項。
tensorflow/graphics
一個為 TensorFlow 提供可微分圖形與幾何層的函式庫,透過「分析與合成」進行分析,實現 3D 視覺模型的自我監督式訓練。
HasnainRaz/Fast-SRGAN
基於 SR-GAN 的即時超解析度實作,利用像素洗牌高效地將低解析度影片上採樣至高解析度。
levyflux/AViD
AViD 是一個使用 LoRA 和 EMA 進行微調的框架,可高效地將開放式詞彙物件偵測器 Grounding DINO 適配至自訂資料集。
lartpang/SAMs-CDConcepts-Eval
一個全面的評估框架,用於測試 SAM 和 SAM 2 在影像與影片中分割醫學病灶與工業缺陷等上下文依賴概念的能力。
Luo-Yihao/FaithC
一種近乎無損的 3D 體素表示系統,透過 Faithful Contour Tokens (FCTs) 取代 SDF 和 Marching Cubes,以保留銳利邊緣與內部結構。
google-ar/arcore-ios-sdk
一個將 Google 的跨平台 ARCore 功能(包括雲端錨點與地理空間 API)引入 iOS 應用的軟體開發工具包。
arthurflor23/handwritten-text-recognition
基於 TensorFlow 的框架,支援廣泛的資料增強與多種標準 HTR 資料集,用於手寫文字辨識與合成。
openMVG/openMVG
用於從影像(攝影測量)進行3D重建的C++框架,提供解決結構從運動問題的函式庫與流程。
argoverse/argoverse-api
一個用於存取自動駕駛研究中 HD 地圖、3D 追蹤資料與運動預測序列的 Python API。
ShenhanQian/VHAP
VHAP 是一個用於人頭對齊的光度最佳化管道,利用自適應外觀先驗來追蹤單鏡頭與多鏡頭影片中無特徵點的區域,如頭髮與耳朵。
lartpang/PySODMetrics
一個輕量級的 Python 庫,用於計算顯著物件檢測(SOD)指標,提供比 Matlab 基礎評估工具箱更快且可驗證的替代方案。
naruya/gaussian-vrm
一個three.js實作,可讓真實感強、可動畫的3D角色在Web、行動與VR應用中渲染。
worldcoin/open-iris
結合電腦視覺與機器學習技術,實現安全生物辨識驗證與大規模唯一性確認的進階虹膜識別流程。
MrGiovanni/SyntheticTumors
一種用於生成真實感合成腫瘤以訓練AI分割模型的框架,減少對人工標註醫學影像資料的依賴。
MrGiovanni/AbdomenAtlas
透過人機協同 AI,提供大規模多器官 CT 資料集與工具集,將腹部分割的標註時間從數十年縮短至數週。
foo123/FILTER.js
一個純 JavaScript 圖像與影片處理及電腦視覺庫,支援透過 WebGL、WebAssembly 與 Web Workers 實現硬體加速。
Unity-Technologies/arfoundation-samples
一組官方 Unity 範例場景與程式碼,展示如何使用 AR Foundation 實作跨多平台的擴增實境功能。
pyushkevich/itksnap
ITK-SNAP 是一款開源軟體應用程式,用於在醫學影像中對解剖結構進行使用者引導的 3D 活性輪廓分割。
tudelft-iv/view-of-delft-dataset
一個包含同步LiDAR、相機與3+1D雷達資料的多感測器汽車資料集,附帶城市交通中道路使用者檢測的3D邊界框標註。
dstndstn/astrometry.net
Astrometry.net 是一個用於自動識別天文影像的工具,為未知天空位置的影像提供天體座標與校準元資料。
MouseLand/suite2p
一個用於處理雙光子鈣成像資料的流程,透過註冊、ROI 檢測與尖峰檢測提取大規模神經活動。
ducha-aiki/pydegensac
用於從稀疏影像對應關係中估計單應性與基本矩陣的 Python 封裝,基於 LO-RANSAC 與 DEGENSAC
mapillary/OpenSfM
一個以 Python 編寫的結構從運動(SfM)程式庫,可從多張影像重建 3D 景觀與相機姿態,並整合感測器資料以實現地理對齊。
bcmi/Image-Harmonization-Dataset-iHarmony4
提供大規模影像調和資料集(iHarmony4)與 DoveNet 的 PyTorch 實作,協助模型讓插入物件在合成影像中看起來更自然。
Pointcept/Concerto
一種用於從 3D 點雲中提取高品質空間表示的聯合 2D-3D 自監督預訓練 Point Transformer V3 模型。
hanna-xu/U2Fusion
一個統一的無監督影像融合網路,能將多模態、多重曝光和多焦點影像合併為單一高品質影像,且無需標記訓練資料。
IvanDrokin/torch-conv-kan
TorchConv‑KAN 是一個 PyTorch 庫,實現卷積層,其中每個核由一組可學習的一元函數(KAN、Fast‑KAN、Cheby‑KAN 等)構成。它包含多種層變體、CNN 風格模型家族(ResKANet、DenseKANet、VGG‑KAN、U‑Net‑KAN)、預訓練的 ImageNet‑1k 檢查點,以及使用 Accelerate、Hydra、WandB 和 Ray‑Tune 的訓練腳本。該專案正在積極開發中,並搭配發表一篇關於柯爾莫哥洛夫-阿諾德卷積的研究論文。
MIC-DKFZ/nnDetection
一種用於醫學影像中物件同時定位與分類的自配置框架,透過自動化配置流程,適應任意醫學檢測問題。
Mark12Ding/SAM2Long
SAM2Long 是一種無需訓練的 SAM 2 增強技術,透過記憶樹防止誤差累積,提升長影片中的物件分割效能。
Altaheri/EEG-ATCNet
基於TensorFlow的注意力時序卷積網路(ATCNet)實作,用於分類運動想像EEG訊號,以提升腦-電腦介面效能。
Sompote/DINOV3-YOLOV12
結合YOLOv12與DINOv3的混合物件檢測框架,可在小規模或複雜資料集上提供更優準確度與更快收斂速度。
schappim/macOCR
一款適用於 macOS 的命令列 OCR 工具,使用 Apple 的 Vision 框架從螢幕、圖片或 PDF 中擷取文字、QR 碼和條碼。
EyeTrackVR/EyeTrackVR
一個開源且價格實惠的VR眼動追蹤平台,可透過OSC和UDP協定在VRChat中實現眼動追蹤。
nipy/nipype
一個 Python 專案,提供神經影像軟體的統一介面,讓使用者能將不同套件的工具整合成單一、可重現的工作流程。