qubvel-org/segmentation_models.pytorch
一個提供圖像語義分割高階 API 的 PyTorch 函式庫,具備 12 種架構與超過 800 個預訓練編碼器。
10x-Engineers/Infinite-ISP
一個從 Python 基礎演算法設計到 RTL 與 FPGA 實作的完整 ISP 開發平台,用於將 RAW 傳感器影像轉換為 RGB。
scier/MetalSplatter
一個基於 Swift/Metal 的函式庫,可在 iOS、macOS 與 visionOS 上實時呈現 3D 景觀。
google-ar/arcore-android-sdk
ARCore SDK for Android 提供用於運動追蹤、環境理解與光照估計的 API,以建構擴增實境體驗。
Smorodov/Multitarget-tracker
一個結合了 SOTA 深層學習檢測器、匹配演算法與 Kalman filters 的全面性多目標追蹤框架,用於在影片中追蹤多個目標。
VisionDepth/VisionDepth3D
VisionDepth 3D 是一款 Windows 桌面應用程式,它使用 AI 深度模型、深度圖混合、RIFE 畫格插值和 AI 超解析度技術,將 2D 影像或影片轉換為立體 3D。它提供了一個免費版(長度受限、1080p、有浮水印)和一個一次性付費 59.99 美元的 Pro 專業版(無限制、4K+、批次處理、進階控制)。安裝方式是透過 Itch.io 的「Setup Hub」來提供 CUDA (NVIDIA) 或 DirectML (AMD/Intel) 版本。該軟體是專有軟體,但它下載的 AI 模型是在其各自授權條款下的開源模型。
SimpleITK/SimpleITK
一個為影像分割與配準提供對 Insight Segmentation and Registration Toolkit (ITK) 簡化介面的影像分析工具包。
rdk/p2rank
一種基於機器學習的命令列工具,可快速且準確地從蛋白質結構中預測配體結合位點。
illuin-tech/colpali
ColPali 是一個用於視覺文件檢索的研究程式庫。它使用視覺-語言模型(例如 PaliGemma、Qwen‑VL)將文件影像編碼為多向量嵌入,並使用類似 ColBERT 的延遲互動方法對查詢嵌入進行評分。原始的 `colpali-engine` 套件(現已棄用)提供模型類、處理器、可選融合內核、快速 Plaid 索引、令牌池化和可解釋性工具。新專案應使用 Sentence‑Transformers v6 的 `MultiVectorEncoder`,它整合了 ColPali 風格的模型。
zju3dv/MatchAnything
MatchAnything 是一項研究計畫,訓練單一神經網路以在任何視覺模態(例如 RGB、紅外線、草圖)的影像之間找到對應關係。預訓練權重已托管於 Hugging Face,並提供線上示範,讓使用者可立即試用跨模態匹配。此方法旨在以一個通用模型取代多個專用匹配流程,適用於機器人、遙測、醫學影像與 AR 等領域。
weecology/DeepForest
一個用於在航空 RGB 影像中使用深度學習目標檢測進行樹冠與鳥類等生態對象訓練與預測的 Python 套件。
nianticlabs/map-free-reloc
A reference implementation for map-free visual relocalization that enables metric pose estimation relative to a single image, removing the need for large 3D maps.
alephpi/Texo
一個僅包含 20M 參數的極簡開源 LaTeX OCR 模型,可將數學公式圖像轉換為 LaTeX 程式碼。
xg-chu/GAGAvatar
GAGAvatar 是一個利用 3D 高斯點陣從單張影像實現 3D 頭部虛擬角色重建並支援即時重演的框架。
mgonzs13/yolo_ros
一個用於 Ultralytics YOLO 模型的 ROS 2 封裝,讓機器人能實現物件檢測、追蹤、實例分割與 3D 物件定位。
microsoft/farmvibes-ai
面向農業與永續性的多模態地理空間機器學習框架,融合衛星影像、氣象資料與高程圖,生成穩健的農業洞察。
z1069614715/objectdetection_script
一個用於改進和壓縮目標檢測模型的綜合工具包,具有改進的 YOLO 和 RT-DETR 架構、剪枝、蒸餾和多模態支持。
ucam-eo/geotessera
一個用於讀取、匯出和視覺化 Tessera Earth 基礎模型地理空間嵌入的 Python 函式庫,支援雲端原生串流和本機瓦片下載。
opencap-org/opencap-core
一個從多個智慧型手機影片中估計3D人體運動學與標記位置的管道,輸出資料為 OpenSim 格式。
openmv/openmv
一個開源的機器視覺平台,讓初學者能使用 Python3 在微控制器上實現 AI 與影像處理。
DanBloomberg/leptonica
一個由 Tesseract 和 OpenCV 等專案使用的全面 ANSI C 影像處理與分析函式庫,用於處理文件與自然影像。
nipreps/mriqc
一個開源工具,可從結構、功能與擴散 MRI 數據中提取無參考影像品質指標,實現自動化品質評估。
luxonis/oak-examples
Luxonis OAK 裝置的示範與教學合集,展示使用 DepthAI 實作 AI 視覺、深度測量與神經網路的應用。
ANTsX/ANTsPy
ANTs C++ 框架的 Python 封裝,提供高效率工具用於生物醫學影像註冊、分割與處理。
sstary/SSRS
一個 PyTorch 收集,包含用於遙測語義分割的深度學習模型,涵蓋單模態、多模態融合與無監督域適應技術。
jianboqi/CSF
一種基於布料模擬的 LiDAR 濾波方法,用於分離空中點群中的地面點與非地面點。
sentinel-hub/eo-learn
一個連結地球觀測資料與機器學習生態系統的 Python 套件,簡化從時空衛星影像中提取資訊的過程。
zibo-chen/ocr-rs
基於 PaddleOCR 模型與 MNN 推理執行環境的輕量級 Rust OCR 庫,支援 50 多種語言的文本檢測與辨識。
apple-aiml-research/ml-cvnets
一個用於訓練與評估標準及新型行動裝置與非行動裝置模型,以執行分類、檢測與分割等任務的電腦視覺工具箱。
vietanhdev/samexporter
一個用於在 ONNX Runtime 中匯出並執行 SAM, SAM 2, SAM 3, MobileSAM 和 EfficientSAM 模型的工具,以實現可攜式且高效率的部署。
NativeSensors/EyeGestures
一個開源眼動追蹤程式庫,可使用標準網路攝影機與手機相機,而非昂貴的專用硬體,實現眼控介面。
Jianghanxiao/PhysTwin
PhysTwin 是一個研究用程式碼庫,可從 RGB-D 影片重建物理資訊驅動的可變形物體數位孿生體,並提供互動式模擬、分析工具,以及用於機器人規劃與批次模擬的範例管線。
facebookresearch/pytorch3d
一個基於 PyTorch 的 3D 電腦視覺研究庫,提供可微渲染以及用於操作 3D 網格與點雲的高效工具。
Yuliang-Liu/MultimodalOCR
一套用於評估大型多模態模型在多種語言與真實世界情境下OCR與文件解析能力的基準測試(MDPBench、OCRBench v2、OCRBench)集合。
yehonathanlitman/Lift4D
Lift4D 透過將每幀的 3D 估計融合至可變形模型中,從單一視角的「野外」影片中重建出時間一致的 4D 資產。
NVIDIA-RTX/RTXNS
一個用於將機器學習整合至圖形應用程式中的開發者框架,使神經網絡能用來表示著色器和貼圖。
ultralytics/yolo-flutter-app
一個官方的 Ultralytics 插件,可在 iOS 與 Android 上實作即時 YOLO 模型推論,支援物件偵測、分割與姿態估計。
agentmorris/MegaDetector
一個能識別相機陷阱影像中動物、人與車輛的AI模型,協助保育生物學家有效移除空白影像。
alexandremendoncaalvaro/CorridorKey-Runtime
一款原生 AI 抠像執行環境與 OFX 外掛,適用於 DaVinci Resolve 與 Foundry Nuke,為影片編輯者提供自動化、機器學習加速的背景移除功能。
torchgeo/terratorch
一個基於 PyTorch 的領域函式庫,用於微調與使用預訓練的地理空間基礎模型,支援影像分割與分類等任務。
kornia/kornia-rs
一個使用 Rust 編寫的低層級電腦視覺函式庫,為實時 ML 流水線在 CPU 和 NVIDIA GPU 上提供快速、零複製的圖像處理。
raphaelvallat/yasa
一個基於 Python 的睡眠分析工具箱,用於自動進行多導睡眠圖與 EEG 資料的睡眠分期與事件檢測。
MrGiovanni/UNetPlusPlus
一種用於醫學影像分割的嵌套 U-Net 架構,透過重新設計跳接連接並允許靈活的網路深度,改善了原始 U-Net。
allenai/olmoearth_pretrain
一系列用於地球觀測的跨模態、時空基礎模型,為利用衛星數據進行行星智能提供可擴展的框架。
ultralytics/yolo-ios-app
一個原生 iOS 應用與 Swift SDK,利用 Core ML 與 Apple Neural Engine 實現裝置端即時 YOLO 推論,支援物件偵測、分割與姿態估計。
next-state/open-dreamer
Open Dreamer 是 JAX/Flax 實作的 Dreamer 4 世界模型管道,提供 Minecraft 遊戲玩法資料上視訊分詞器與動作條件的潛在動力學模型的訓練程式碼,以及滾動生成與 FVD 評估工具。包含一個瀏覽器內即時示範與一個獨立推理倉儲,可用於執行訓練好的檢查點。
noahcao/OC_SORT
一個純粹基於運動模型的多目標追蹤器,透過重新思考 SORT 演算法,在擁擠場景與非線性運動下提升魯棒性。
zju3dv/manhattan_sdf
Manhattan‑SDF 是 CVPR‑2022 的研究程式碼,透過學習室內 3‑D 重建的神經符號距離函數(SDF),並引入曼哈頓世界(軸對齊)正則化以提升幾何品質。提供基於 conda 的安裝方式、ScanNet(或自訂資料)的訓練腳本、網格提取功能以及與多種基線的評估功能。