google/cameratrapai

一個使用物件偵測器與物種分類器,自動化處理相機陷阱影像中野生動物物種分類的 AI 模型集成。

mprib/caliscope

用於 3D 動作捕捉的多相機校準工具,可估計相機內參與空間位置,以實現精確的 3D 三角化。

linwhitehat/ET-BERT

一種基於 Transformer 的加密網路流量分類模型,透過預訓練與微調學習資料報的上下文關係

allenv0/AirPosture

一款利用 AirPods 的頭部追蹤與本地 AI 技術,為減輕頸部壓力提供即時姿勢指導與提醒的 iOS 應用程式。

LiteReality/LiteReality

LiteReality 將行動裝置取得的 RGB-D 掃描資料轉換為具備物理基礎渲染材質的圖形就緒 3D 場景,實現高保真重建。

3dem/relion

RELION 是一款用於在冷凍電子顯微鏡中進行 3D 重建和 2D 類別平均值的最大後驗概率(Maximum A Posteriori)精煉的軟體程式。

cvg/glue-factory

A library for training and evaluating deep neural networks that extract and match local visual features, supporting state-of-the-art models like LightGlue and GlueStick.

cvg/limap

一個用於整體式 3D 地圖建構與運動結構的工具箱,能共同優化點、線條、平面與參數化原始形狀,以實現更精確的 3D 重建。

nvpro-samples/vk_gaussian_splatting

一個基於Vulkan的高性能檢視器與測試平台,可比較3D高斯潑射模型的光柵化、光線追蹤與混合渲染技術。

OschAI/VisioFirm

一個基於 AI 的影像與影片標註工具,利用 SAM2 和 YOLO 等模型,為電腦視覺資料集提供半自動化預標註。

PRBonn/RAP

一種使用流匹配將多個未對齊掃描對齊至統一座標系的 3D 點群配準框架,將配準視為條件生成任務。

UB-Mannheim/zotero-ocr

一個使用 Tesseract OCR 為 Zotero 資料庫中的掃描 PDF 加上可搜尋文字層的 Zotero 外掛。

Linketic/CityGaussian

基於高斯點陣的高品質、大規模 3D 景觀重建框架,支援多 GPU 與幾何精確渲染。

drivelineresearch/openbiomechanics

一個提供清洗後的運動捕捉檔案、時序生物力學與身體評估指標的公開研究資料集,用於棒球投球與擊球分析。

ScrollPrize/villa

一套用於Vesuvius Challenge的機器學習與電腦視覺工具,可從CT掃描中虛擬展開並讀取古代赫庫蘭尼姆卷軸。

dstl/Stone-Soup

Stone Soup 是一個用於開發與測試目標追蹤與狀態估計演算法的框架。

SubhamTyagi/android-ocr

一款注重隱私的 Android 應用,使用 Tesseract 5 在超過 120 種語言中實現離線光學字元辨識(OCR)

hmorimitsu/ptlflow

一個統一的 PyTorch Lightning 框架,用於訓練和評估大量最尖端的光流估計模型。

oliverbravery/PrintGuard

一種本機視覺監控系統,即時偵測3D列印失敗,自動暫停印表機並提醒使用者,避免浪費耗材。

inspatio/querysplat

QuerySplat 是一個 3D Gaussian Splatting 預測框架,透過解耦幾何和外觀表示來提高從圖像進行 3D 場景重建的品質。

bytedeco/javacv

OpenCV 與 FFmpeg 等流行電腦視覺及影片處理函式庫的 Java 封裝,可在 Java 與 Android 上實現高效能的圖像與影片處理。

tomas-gajarsky/facetorch

一個 Python 庫,用於面部檢測與分析,匯集開源模型並打包為可攜式的 torch.export 模型,以實現高效推論。

ch-sa/labelCloud

一個輕量級的 3D 邊界框標註工具,用於點雲,能產生 3D 目標偵測與 6D 姿態估計的訓練資料。

databricks-industry-solutions/pixels

一個醫療影像解決方案加速器,可攝入並索引 DICOM 檔案,以實現基於 SQL 的元資料分析與使用 MONAI 的 AI 驅動影像分割。

fastvideo/gpu-camera-sample

一個高效率的 GPU 加速相機應用程式,支援多種工業相機,適用於即時原始影像處理與 ISP 流程。

jamjamjon/usls

一個基於 ONNX Runtime 的跨平台 Rust 庫,可高效推理參數量低於 10 億的視覺與視覺-語言模型。

pymatting/pymatting

一個使用 trimap 估計前景物件透明度的 Python 套件,可實現精確的背景移除與合成。

apple-aiml-research/ml-hypersim

Hypersim 是一個大型合成室內數據集(約 77,000 張 HDR 圖像,1.9TB),包含像素級幾何、語意與材質通道,並附帶基於 V‑Ray 的工具包,用於生成與編輯類似資料。專為訓練與評估場景理解模型(深度、法線、分割、內在影像分解)而設計,並包含預設的訓練/驗證/測試分割。

apple-aiml-research/ml-hugs

HUGS 是一個參考實作,使用高斯點陣從單一影片中重建可動畫的人體及其周圍背景場景。

jasongzy/Make-It-Animatable

一個高效的框架,透過從3D網格預測關節位置和蒙皮權重,自動化創建可動畫化的3D角色。

nmwsharp/polyscope

一個輕量級的 C++/Python 3D 檢視器與介面,可快速可視化網格和點雲及其關聯的標量與向量資料。

Anttwo/Surflo

Surflo 是一個 3D 表面流模型,它使用全域狀態和流匹配,將少數未擺姿勢的 RGB 視圖轉換為詳細的 3D 網格。

amebalabs/TRex

一款 macOS 工具,使用 OCR 從任意螢幕區域提取不可選文字並直接複製到剪貼簿。

rtr46/meikipop

一款通用的日本語 OCR 懸浮字典,可從螢幕上任何內容(包括遊戲、漫畫和影片)立即查詢單字。

deepdoctection/deepdoctection

一個用於文件理解的 Python 函式庫,透過編排佈局分析、OCR 和標記分類,從 PDF 和掃描件中提取結構化數據。

nutonomy/nuscenes-devkit

一個針對 nuScenes 與 nuImages 數據集的軟體開發工具包,提供載入、分析與評估自動駕駛研究中多模態感測器資料的工具。

espressif/esp-who

專為 Espressif 晶片設計的圖像處理開發平台,提供人臉與行人檢測及 QR Code 辨識範例。

facebookresearch/OrienterNet

一種深度神經網路,透過將影像與 OpenStreetMap 等 2D 公開地圖比對,確定影像的位置與方向。

mjkwon2021/CAT-Net

一種透過分析 JPEG 壓縮偽影來檢測與定位影像篡改的網路,為影像鑑識研究提供工具。

Project-MONAI/MONAILabel

一個用於 AI 輔助醫學影像標註的智慧開源生態系統,採用伺服器-用戶端架構,為放射學、病理學和內視鏡檢查實現互動式與自動化的標註。

yihong1120/Construction-Hazard-Detection

一個利用YOLO從即時攝影機串流中偵測PPE違規與接近危險的AI驅動建築工地安全監控系統。

zae-bayern/elpv-dataset

一個包含 2,624 張已標註太陽能電池電致發光影像的基準資料集,用於視覺辨識降低功率效率的缺陷。

Climate-Vision/ClimateVision

一個開源機器學習平台,利用深度學習與衛星影像自動偵測森林砍伐、北極冰層融化與洪水。

cuevhv/mamma

MAMMA 是一個無標記的多人 3D 動作捕捉系統,能從多視角影片中重建精確的人體姿態。

emgucv/emgucv

一個用於 OpenCV 函式庫的跨平台 .NET 封裝,讓您可以在 .NET 相容語言中使用影像處理功能。

tianrun-chen/SAM-Adapter-PyTorch

一個用於適配 Segment Anything Model (SAM) 的框架,以提升在偽裝、陰影與醫學影像等挑戰性場景中的表現。

cameraui/camera.ui

一個自架式安全攝影機平台,可在使用者自有硬體上保留影像資料的同時,提供即時觀看、錄影以及本機設備AI偵測功能。

facebookresearch/ocean

Ocean 是一個用於在行動、桌面與 Meta Quest 等多種平台建構電腦視覺與擴增實境應用的 C++ 框架。