StanfordVL/taskonomy

一個用於解耦電腦視覺中任務遷移學習的框架與資料集,提供預訓練任務庫與分析任務親和性的工具。

qaz812345/TrackNetV3

一項電腦視覺專案,透過軌跡預測結合背景估計與基於影像修復的校正模組,提升羽毛球影片中球托追蹤的效能,有效處理遮擋問題。

EthanH3514/AL_Yolo

基於 YOLOv5 的即時視覺目標偵測與追蹤系統,專為遊戲場景中的低延遲螢幕擷取與 GPU 推論進行優化。

Breakthrough/DVR-Scan

一個命令列和 GUI 應用程式,可自動檢測影片檔案中的運動事件,並將每個事件儲存為獨立的片段。

soruly/trace.moe-telegram-bot

一個使用 trace.moe 服務從截圖或影片中識別動畫標題、集數和時間戳的 Telegram 機器人。

pupil-labs/pupil

一個開源的眼動追蹤平台,提供用於捕捉、播放與分析眼動追蹤資料的軟體基礎架構。

ermig1979/Simd

一個使用SIMD CPU擴展加速演算法的高效率C/C++影像處理與機器學習函式庫,適用於x86、ARM與Hexagon架構。

iago-suarez/ELSED

ELSED 是一種為無人機和智慧型手機等資源受限裝置設計的高速線段檢測器。

Faceplugin-ltd/FaceRecognition-Android

適用於 Android 的在地設備人臉辨識與活體檢測 SDK,支援私密、離線生物辨識身分驗證與屬性分析。

stereolabs/zed-unity

一個 Unity 外掛程式,將 ZED 相機的深度感測、空間映射與物件偵測功能整合到 Unity 引擎,以支援 AR/MR 開發。

deepfates/memery

利用 OpenAI 的 CLIP 技術,透過文本或圖像查詢在本地資料夾中尋找特定圖像的自然語言圖像搜尋工具。

nachifur/MulimgViewer

專為高效比較、過濾和拼接大規模圖像數據集而設計的多圖查看器,具有並行縮放和自動圖表生成功能。

VicenteVivan/geo-clip

GeoCLIP 是一個受到 CLIP 啟發的模型,它將影像與地理位置對齊,以實現高精度的全球影像地理定位以及 GPS 到向量的 embeddings。

lartpang/PySODEvalToolkit

一個用於評估灰階與二值影像分割模型的 Python 工具箱,提供全面的指標與自動化曲線繪圖功能。

OSU-NLP-Group/UGround

UGround 是一個開源視覺語言模型(2B/7B/72B),經過微調以根據文字描述在螢幕截圖中定位 UI 元素。該倉儲提供預訓練權重、超過 100 萬張圖像的 GUI 定位資料集、四個基準的評估腳本,以及 Hugging Face 示範。推論透過 vLLM 實現,使用簡單提示即可返回 (x, y) 座標。72B 模型在 ScreenSpot 基準上達成最尖端表現,並被 ICLR 2025 接受為口頭報告論文。

juliansteenbakker/mobile_scanner

一個快速、輕量的 Flutter 插件,支援 Android、iOS、macOS 與 Web,透過裝置相機實現即時條碼與 QR 碼掃描,並支援可自訂的相機行為。

bopen/sarsen

一個用於雲原生合成孔徑雷達(SAR)處理的 Python 庫,提供 Sentinel-1 衛星資料的幾何與輻射地形校正。

leomariga/pyRANSAC-3D

用於將基本幾何形狀擬合到3D點雲的Python實作,適用於3D重構和SLAM。

ouster-lidar/ouster-sdk

一個跨平台的 C++/Python 開發工具包,用於連接、設定和視覺化來自 Ouster Lidar 傳感器的資料。

opencv/opencv_extra

補充 OpenCV 電腦視覺函式庫核心功能的額外數據與資源庫。

Thinklab-SJTU/ThinkMatch

一個用於開發與基準測試深度圖匹配演算法的研究框架,旨在在圖之間找到節點對節點的對應關係。

liuliu/ccv

一個極簡且可移植的基於 C 的電腦視覺函式庫,提供用於人臉、物體和文字檢測的最先進演算法。

PaddlePaddle/PaddleClas

一個全面的圖像識別與分類工具包,為高性能視覺應用提供超輕量級模型與工業級骨幹網絡。

SegmentationBLWX/sssegmentation

一個基於 PyTorch 的監督式語義分割工具箱,提供統一框架與廣泛模型倉庫,用於訓練與測試分割演算法。

LAION-AI/CLIP_benchmark

一個標準化的評估框架,用於衡量 CLIP 類模型在零樣本分類、檢索、影像描述生成與線性探測等任務上,跨多種資料集的效能。

facebookresearch/mvdust3r

一種單階段 3D 場景重建工具,只需約 2 秒即可從稀疏 RGB 視圖中建立 3D 點雲與相機姿態,無需預先知道相機姿態。

zsylvester/segmenteverygrain

一個用於透過混合 U-Net 與 SAM 2.1 方法檢測與分割影像中顆粒的 Python 套件,專為地貌學與沉積地質學研究設計。

phamquiluan/ResidualMaskingNetwork

使用殘差遮罩網路從影像與即時影片串流中偵測人類情感的面部表情辨識系統。

NVlabs/nvdiffrecmc

使用蒙特卡洛渲染與去噪技術,基於多視角影像聯合重建3D拓撲、材質與光照的PyTorch實作。

adalca/neurite

用於醫學影像分析的神經網路工具箱,提供專用張量運算、預建架構與空間資料繪圖工具。

scribeocr/scribe.js

一個用於從圖像和 PDF 進行 OCR 和文本提取的 JavaScript 庫,能夠創建具有不可見文本層的可搜索 PDF。

hysts/anime-face-detector

一個基於 PyTorch 的工具,用於偵測動畫臉部並使用預訓練的 Faster R-CNN、YOLOv3 與 HRNetV2 模型估計 28 個臉部特徵點。

mkalten/reacTIVision

一個跨平台的電腦視覺框架,用於追蹤基準標記與多點觸控手指,讓實體使用者介面的開發變得可能。

roboflow/roboflow-python

Roboflow 的官方 Python 套件,讓開發者能以程式化方式與模型、資料集和專案互動,從而自動化建立與部署電腦視覺模型。

lessthanoptimal/BoofCV

以 Java 寫成的即時電腦視覺函式庫,提供低階影像處理、相機校準與特徵追蹤的工具。

githubharald/SimpleHTR

一個基於 TensorFlow 的手寫文字辨識系統,使用 CNN 與 LSTM 層將單字或文字行的影像轉換為數位文字。

scribeocr/scribeocr

一個瀏覽器端的網路應用程式,用於從影像中辨識文字,以高精度校對OCR資料,並建立完全數位化、ebook風格的文件。

visionworkbench/visionworkbench

由 NASA 開發的 C++ 函式庫,用於通用型影像處理與電腦視覺,提供相機模型、地圖投影與馬賽克合成工具。

openclimatefix/graph_weather

一個基於 PyTorch 的程式庫,實現多種圖神經網絡用於天氣預報與資料同化,包含 GenCast 和 Aurora 等模型。

norlab-ulaval/libpointmatcher

一個帶有 Python 綁定的模組化 C++ 庫,用於在機器人學與電腦視覺中對 3D 點群進行配準。

owensgroup/RXMesh

一個用於處理三角網格的 GPU 加速庫,具備整合的矩陣基礎設施與用於幾何處理任務的自動微分功能。

PoseLib/PoseLib

一套用於相機位姿估計的極小求解器與穩健估計器集合,支援多種對應關係與相機模型,且依賴項極少。

PozzettiAndrea/ComfyUI-SAM3

Meta的SAM3 ComfyUI整合,支援使用自然語言文字提示進行開放式詞彙影像與影片分割。

UCSC-VLAA/OpenVision

一組面向多模態學習的開源、低成本視覺編碼器,優化理解與生成任務中的訓練效率與效能。

Seeed-Studio/OSHW-reCamera-Series

針對邊緣 AI 的 reCamera 系列 AI 驅動視覺模組之開源硬體文件與設計資源中心。

CellProfiler/CellProfiler

CellProfiler 是一款開源軟體,使生物學家無需程式設計或電腦視覺專業知識,即可自動且定量地從數千張影像中測量表型。

TechyNilesh/DeepImageSearch

一個用於建構支援文字、影像與混合搜尋的 AI 驅動影像搜尋系統的 Python 庫,採用多模態嵌入與向量索引技術。

MITK/MITK

一個開源的 C++ 工具包,透過結合 ITK 和 VTK,用於開發互動式醫學影像處理軟體。