vturrisi/solo-learn

基於 PyTorch Lightning 的自監督學習方法庫,用於無監督視覺表示學習,提供訓練與比較 SOTA 視覺模型的統一環境。

kevinhughes27/TensorKart

這是一個基於 TensorFlow 的專案,透過學習人類的遊戲錄影來訓練 AI 代理駕駛《瑪利歐賽車 64》。

spytensor/prepare_detection_dataset

一組用於在 CSV、COCO、Pascal VOC 和 Labelme 格式之間轉換物件檢測資料集標註的 Python 腳本。

XieZhiFa/IdCardOCR

一個適用於 Android 的離線 OCR 套件,可在無需網路連接的情況下,實現對中國身分證、駕照與護照的高速識別。

kadirnar/segment-anything-video

Segment Anything Model (SAM) 的封裝版本,支援透過 pip 簡易安裝,並擴展影片分割與雲端 GPU 集成功能。

neka-nat/probreg

一種使用機率模型的點群配準程式庫,為剛性與非剛性變換提供了比ICP更穩健的替代方案。

facebookresearch/mobile-vision

包含 FBNet 與 ChamNet 等硬體感知高效 ConvNet 模型與工具的集合,專為優化行動裝置上的電腦視覺效能與延遲而設計。

XiandaGuo/OpenStereo

整合17個資料集與多個最尖端模型的深度估計綜合基準與框架。

JoHof/lungmask

一套用於CT掃描中自動肺分割的訓練好的U-net模型,能處理嚴重病變並實現肺葉特異性遮罩。

TechStark/opencv-js

一個將 OpenCV 計算機視覺庫帶入 Node.js 與 Web 瀏覽器的 NPM 套件,使 JavaScript 能執行即時人臉偵測等任務。

oarriaga/paz

用於自主系統的分層感知庫,提供使用 TensorFlow 和 Keras 構建電腦視覺流水線的模組化 API。

Deep-MI/FastSurfer

一種基於深度學習的快速神經影像處理流程,用於腦部 MRI 圖像的體積與表面基礎厚度分析,作為 FreeSurfer 的高速替代方案。

yzfzzz/depth-detect

一個高效率的 C++ 與 TensorRT 框架,融合 YOLO 物件檢測與單眼/雙眼深度估計,用於即時追蹤物件並估算其運動狀態。

prov-gigapath/prov-gigapath

一種用於數位病理科的全切片基礎模型,採用切片與整片編碼器架構,用於分析龐大的病理影像。

david8862/keras-YOLOv3-model-set

一個全面的 TensorFlow Keras 流程,支援 YOLOv2、v3 與 v4 物件檢測,涵蓋多樣骨幹網路、進階訓練技術,並支援裝置端部署。

talmolab/sleap

一個利用人機協同 GUI 快速標記並量化動物行為的多動物姿態追蹤深度學習框架。

francescofugazzi/3dgsconverter

一款高性能工具,支援在多種格式間轉換3D高斯潑濺檔案,並具備GPU加速過濾與壓縮功能。

matiasdelellis/facerecognition

一個為 Nextcloud 所設計的面部辨識應用,可在本地檢測、分析並分組影像中的人臉,實現私密的以人物為基礎的照片組織。

FaceAISDK/FaceRecognition_ReactNative

一個 React Native 示範與整合指南,用於支援 iOS 與 Android 上 1:1 驗證與活體檢測的離線人臉辨識 SDK。

kanadeblisst00/wechat_ocr

一個允許使用者呼叫 WeChat Windows 客戶端內建的本地 OCR 模型,對影像進行文字辨識的 Python 庫。

kyegomez/VisionMamba

Vision Mamba是一種雙向狀態空間模型,用於高效視覺表示學習,其速度顯著快於傳統視覺Transformer,且記憶體效率更高。

facebookresearch/pixio

Pixio 是一種透過增強像素重建預訓練優化之視覺編碼器,適用於深度估計與語義分割等密集預測任務。

microblink/blinkid-android

使用機器學習與原生 C++ 庫的 Android SDK,用於安全的身份證明文件掃描與資料提取。

jiafeng5513/Evision

一個使用 ELAS 和 ADCensus 等演算法進行相機校準、視差映射與 3D 重建的雙目視覺系統。

infinitered/react-native-mlkit

一組包裝 Google 的 MLKit 原生程式庫的 Expo 模組,讓 Expo 應用能實現人臉與物件檢測等設備端機器學習功能。

hujiecpp/PE3R

PE3R 是一種感知高效的 3D 重構系統,利用零樣本泛化將 2D 圖像轉換為語義理解的 3D 場景。

dluvizon/deephar

一個用於即時 2D 與 3D 人體姿態估計及動作辨識的多任務深度學習框架。

aparsoft/yolo-streamlit-detection-tracking

基於Streamlit的視覺工作室,使用YOLO26與YOLO World v2實現實時物件檢測、分割、姿態估計與追蹤。

prov-gigatime/GigaTIME

一個從常規 H&E 病理切片生成腫瘤微環境建模用虛擬空間蛋白質體(mIF)特徵的多模態 AI 專案。

AI4EPS/PhaseNet

一種基於深度神經網路的方法,可從原始地震資料中自動拾取地震到時(P波與S波)

ml-struct-bio/cryodrgn

一種基於神經網路的演算法,用於對異質性冷凍電鏡與冷凍電鏡斷層成像中的連續3D結構分佈進行建模。

lartpang/PyIRSTDMetrics

一個輕量級的 Python 庫,用於使用像素級、目標級和混合指標分析紅外小目標檢測模型的性能。

lingxitong/MIL_BASELINE

一個用於計算病理學中 Multiple Instance Learning (MIL) 的統一庫,提供標準化框架,以實現並比較多種 MIL 架構,適用於全切片影像分析。

FaceAISDK/FaceAISDK_iOS

一款用於 iOS 的裝置端全離線 SDK,提供人臉檢測、識別與活體檢測,無需網路即可實現安全的身分驗證。

quickpose/quickpose-ios-sdk

用於即時姿態估計與骨骼追蹤的 iOS SDK,提供運動計數與活動範圍分析的預建工具。

PozzettiAndrea/ComfyUI-SAM3DBody

Meta的SAM 3D Body用ComfyUI封裝,可從單張影像實現全身體3D人體網格還原。

paninski-lab/lightning-pose

一個使用 Transformer 架構的端到端動物姿態估計套件,可在單視角與多視角影片中穩健追蹤運動,尤其在遮蔽情況下表現出色。

radekd91/inferno

用於野外環境下3D臉部重構與動畫的深度學習程式庫,提供音訊驅動虛擬形象與情緒辨識工具。

NKI-AI/direct

一個用於加速 MRI 重建的 PyTorch 工具包,提供從採樣、重建到驗證的端到端深度學習流程。

BuntingLabs/mundi.ai

Mundi 是一個開源網路 GIS,利用 LLM 自動化向量、光柵與點雲資料的地理處理演算法與符號化編輯。

mapillary/seamseg

一種基於CNN的全景分割架構,可為影像中每個像素預測類別與實例特定的標籤。

RongLiu-Leo/beta-splatting

一項即時輻射場渲染專案,透過以可變貝塔核取代高斯核,提升幾何細節、色彩表現與記憶體效率。

RizwanMunawar/yolov7-object-tracking

一個整合了 YOLOv7 與 YOLOv8,用於在各種來源的影片串流中進行即時目標檢測與追蹤的電腦視覺專案。

realsee-developer/RealSee3D

專為 3D 重建與語義分割 AI 模型訓練設計的包含 10,000 個室內場景的大規模多視圖 RGB-D 資料集。

Tobias-Fischer/rt_gene

使用 PyTorch 與 ROS 2 的即時眼動與眨眼估計系統,用於在自然環境中追蹤視線方向與眨眼機率。

TIGER-AI-Lab/Pixel-Reasoner

Pixel Reasoner 是一個研究框架,為視覺-語言模型添加視覺操作(如縮放、選幀等),透過指令微調與好奇心驅動的強化學習進行訓練。該倉庫提供安裝指南、SFT 與 RL 階段的腳本、預訓練的 7B 檢查點、資料集,以及圖像與影片基準的評估流程。

jabberjabberjabber/ImageIndexer

一款本地 AI 工具,可自動生成圖像的說明文字和關鍵字,並將其直接寫入圖像元數據中,以便於索引和搜尋。

yuanze-lin/Olympus

一個電腦視覺的通用任務路由器,可將單一自然語言指令轉換為一系列專業模型呼叫,以產生影像、影片和3D模型。