google/cameratrapai
一個使用物件偵測器與物種分類器,自動化處理相機陷阱影像中野生動物物種分類的 AI 模型集成。
mprib/caliscope
用於 3D 動作捕捉的多相機校準工具,可估計相機內參與空間位置,以實現精確的 3D 三角化。
linwhitehat/ET-BERT
一種基於 Transformer 的加密網路流量分類模型,透過預訓練與微調學習資料報的上下文關係
allenv0/AirPosture
一款利用 AirPods 的頭部追蹤與本地 AI 技術,為減輕頸部壓力提供即時姿勢指導與提醒的 iOS 應用程式。
LiteReality/LiteReality
LiteReality 將行動裝置取得的 RGB-D 掃描資料轉換為具備物理基礎渲染材質的圖形就緒 3D 場景,實現高保真重建。
3dem/relion
RELION 是一款用於在冷凍電子顯微鏡中進行 3D 重建和 2D 類別平均值的最大後驗概率(Maximum A Posteriori)精煉的軟體程式。
cvg/glue-factory
A library for training and evaluating deep neural networks that extract and match local visual features, supporting state-of-the-art models like LightGlue and GlueStick.
cvg/limap
一個用於整體式 3D 地圖建構與運動結構的工具箱,能共同優化點、線條、平面與參數化原始形狀,以實現更精確的 3D 重建。
nvpro-samples/vk_gaussian_splatting
一個基於Vulkan的高性能檢視器與測試平台,可比較3D高斯潑射模型的光柵化、光線追蹤與混合渲染技術。
OschAI/VisioFirm
一個基於 AI 的影像與影片標註工具,利用 SAM2 和 YOLO 等模型,為電腦視覺資料集提供半自動化預標註。
PRBonn/RAP
一種使用流匹配將多個未對齊掃描對齊至統一座標系的 3D 點群配準框架,將配準視為條件生成任務。
UB-Mannheim/zotero-ocr
一個使用 Tesseract OCR 為 Zotero 資料庫中的掃描 PDF 加上可搜尋文字層的 Zotero 外掛。
Linketic/CityGaussian
基於高斯點陣的高品質、大規模 3D 景觀重建框架,支援多 GPU 與幾何精確渲染。
drivelineresearch/openbiomechanics
一個提供清洗後的運動捕捉檔案、時序生物力學與身體評估指標的公開研究資料集,用於棒球投球與擊球分析。
ScrollPrize/villa
一套用於Vesuvius Challenge的機器學習與電腦視覺工具,可從CT掃描中虛擬展開並讀取古代赫庫蘭尼姆卷軸。
dstl/Stone-Soup
Stone Soup 是一個用於開發與測試目標追蹤與狀態估計演算法的框架。
SubhamTyagi/android-ocr
一款注重隱私的 Android 應用,使用 Tesseract 5 在超過 120 種語言中實現離線光學字元辨識(OCR)
hmorimitsu/ptlflow
一個統一的 PyTorch Lightning 框架,用於訓練和評估大量最尖端的光流估計模型。
oliverbravery/PrintGuard
一種本機視覺監控系統,即時偵測3D列印失敗,自動暫停印表機並提醒使用者,避免浪費耗材。
inspatio/querysplat
QuerySplat 是一個 3D Gaussian Splatting 預測框架,透過解耦幾何和外觀表示來提高從圖像進行 3D 場景重建的品質。
bytedeco/javacv
OpenCV 與 FFmpeg 等流行電腦視覺及影片處理函式庫的 Java 封裝,可在 Java 與 Android 上實現高效能的圖像與影片處理。
tomas-gajarsky/facetorch
一個 Python 庫,用於面部檢測與分析,匯集開源模型並打包為可攜式的 torch.export 模型,以實現高效推論。
ch-sa/labelCloud
一個輕量級的 3D 邊界框標註工具,用於點雲,能產生 3D 目標偵測與 6D 姿態估計的訓練資料。
databricks-industry-solutions/pixels
一個醫療影像解決方案加速器,可攝入並索引 DICOM 檔案,以實現基於 SQL 的元資料分析與使用 MONAI 的 AI 驅動影像分割。
fastvideo/gpu-camera-sample
一個高效率的 GPU 加速相機應用程式,支援多種工業相機,適用於即時原始影像處理與 ISP 流程。
jamjamjon/usls
一個基於 ONNX Runtime 的跨平台 Rust 庫,可高效推理參數量低於 10 億的視覺與視覺-語言模型。
pymatting/pymatting
一個使用 trimap 估計前景物件透明度的 Python 套件,可實現精確的背景移除與合成。
apple-aiml-research/ml-hypersim
Hypersim 是一個大型合成室內數據集(約 77,000 張 HDR 圖像,1.9TB),包含像素級幾何、語意與材質通道,並附帶基於 V‑Ray 的工具包,用於生成與編輯類似資料。專為訓練與評估場景理解模型(深度、法線、分割、內在影像分解)而設計,並包含預設的訓練/驗證/測試分割。
apple-aiml-research/ml-hugs
HUGS 是一個參考實作,使用高斯點陣從單一影片中重建可動畫的人體及其周圍背景場景。
jasongzy/Make-It-Animatable
一個高效的框架,透過從3D網格預測關節位置和蒙皮權重,自動化創建可動畫化的3D角色。
nmwsharp/polyscope
一個輕量級的 C++/Python 3D 檢視器與介面,可快速可視化網格和點雲及其關聯的標量與向量資料。
Anttwo/Surflo
Surflo 是一個 3D 表面流模型,它使用全域狀態和流匹配,將少數未擺姿勢的 RGB 視圖轉換為詳細的 3D 網格。
amebalabs/TRex
一款 macOS 工具,使用 OCR 從任意螢幕區域提取不可選文字並直接複製到剪貼簿。
rtr46/meikipop
一款通用的日本語 OCR 懸浮字典,可從螢幕上任何內容(包括遊戲、漫畫和影片)立即查詢單字。
deepdoctection/deepdoctection
一個用於文件理解的 Python 函式庫,透過編排佈局分析、OCR 和標記分類,從 PDF 和掃描件中提取結構化數據。
nutonomy/nuscenes-devkit
一個針對 nuScenes 與 nuImages 數據集的軟體開發工具包,提供載入、分析與評估自動駕駛研究中多模態感測器資料的工具。
espressif/esp-who
專為 Espressif 晶片設計的圖像處理開發平台,提供人臉與行人檢測及 QR Code 辨識範例。
facebookresearch/OrienterNet
一種深度神經網路,透過將影像與 OpenStreetMap 等 2D 公開地圖比對,確定影像的位置與方向。
mjkwon2021/CAT-Net
一種透過分析 JPEG 壓縮偽影來檢測與定位影像篡改的網路,為影像鑑識研究提供工具。
Project-MONAI/MONAILabel
一個用於 AI 輔助醫學影像標註的智慧開源生態系統,採用伺服器-用戶端架構,為放射學、病理學和內視鏡檢查實現互動式與自動化的標註。
yihong1120/Construction-Hazard-Detection
一個利用YOLO從即時攝影機串流中偵測PPE違規與接近危險的AI驅動建築工地安全監控系統。
zae-bayern/elpv-dataset
一個包含 2,624 張已標註太陽能電池電致發光影像的基準資料集,用於視覺辨識降低功率效率的缺陷。
Climate-Vision/ClimateVision
一個開源機器學習平台,利用深度學習與衛星影像自動偵測森林砍伐、北極冰層融化與洪水。
cuevhv/mamma
MAMMA 是一個無標記的多人 3D 動作捕捉系統,能從多視角影片中重建精確的人體姿態。
emgucv/emgucv
一個用於 OpenCV 函式庫的跨平台 .NET 封裝,讓您可以在 .NET 相容語言中使用影像處理功能。
tianrun-chen/SAM-Adapter-PyTorch
一個用於適配 Segment Anything Model (SAM) 的框架,以提升在偽裝、陰影與醫學影像等挑戰性場景中的表現。
cameraui/camera.ui
一個自架式安全攝影機平台,可在使用者自有硬體上保留影像資料的同時,提供即時觀看、錄影以及本機設備AI偵測功能。
facebookresearch/ocean
Ocean 是一個用於在行動、桌面與 Meta Quest 等多種平台建構電腦視覺與擴增實境應用的 C++ 框架。