liebharc/homr
一個將樂譜照片或 PDF 轉換為機器可讀 MusicXML 檔案的光學樂譜辨識(OMR)軟體。
cvg/vidmap
一種用於影片的離線運動恢復結構系統,利用時間軌跡、閉環檢測和度量深度來估計相機姿態並生成稀疏 3D 地圖。
nv-tlabs/NKSR
Neural Kernel Surface Reconstruction (NKSR) 是一種從大規模、稀疏且雜訊嚴重的點群中生成高品質 3D 隱式表面的方法,能在秒級內處理數百萬個點。
ultralytics/yolov3
Ultralytics YOLOv3 是 YOLOv3 物件偵測模型的 PyTorch 實作,提供三種變體(完整版、SPP、輕量版),並附帶訓練、推論、驗證與多種部署格式匯出的腳本。支援自動下載 COCO 預訓練權重,支援 PyTorch Hub 加載,並與主流 ML-ops 工具及雲端筆記本整合。採用 AGPL‑3.0 授權,同時提供商業企業選項。
lightly-ai/lightly
一個為自監督學習設計的模組化電腦視覺框架,提供眾多先進 SSL 模型的模組化建構模組與實作。
google-ai-edge/model-explorer
Model Explorer 是 Google‑AI‑Edge 的開源視覺化工具,可將 TensorFlow、TFLite、TF‑JS、MLIR 和 PyTorch ExportedProgram 模型渲染為互動式階層圖。它提供 GPU 加速渲染、可搜尋節點、I/O 高亮、元資料覆疊以及可擴充的適配器系統以支援更多格式。
ndl-lab/ndlocr-lite
一款專為家用電腦設計的輕量級OCR工具,無需GPU即可從數位化書籍與雜誌中提取文字。
albumentations-team/AlbumentationsX
一個高效能的 Python 影像增強函式庫,透過建立合成訓練樣本來提高電腦視覺模型的品質和穩健性。
bytedance/Protenix
一個提供蛋白質與 RNA 高準確度 3D 建模的開源生物分子結構預測框架,旨在作為 AlphaFold3 的可存取替代方案。
facebookresearch/MHR
一種使用身份、姿態與面部表情參數生成逼真、可微分人體網格的高保真參數化3D人體模型。
triple-mu/YOLOv8-TensorRT
YOLOv8的高性能TensorRT加速封裝,可在Python與C++中實現檢測、分割、姿態、OBB與分類的快速推論。
cvg/GeoCalib
GeoCalib 是一個研究級 Python 庫,透過深度網路結合幾何最佳化,從單張影像預測相機內參與場景重力方向。支援多種鏡頭模型、部分先驗、批次與多相機陣列校準,並附帶易安裝的推理程式碼、Gradio 網頁示範、Colab 記事本與即時網路攝影機示範。預訓練模型在 OpenPano 資料集(約 37k 個來自 HDR 全景圖的透視裁剪影像)上訓練,已在 LaMAR、MegaDepth、TartanAir 與 Stanford2D3D 等基準上達成最尖端成果。
SunOner/sunone_aimbot_2
一個基於C++的AI瞄準助手,利用電腦視覺模型偵測目標並自動化遊戲中的滑鼠移動。
orbbec/pyorbbecsdk
Orbbec SDK v2.x 的 Python 繫結,讓開發者能與 RGB-D 相機互動,實現深度串流、3D 點雲產生與電腦視覺任務。
luicfrr/react-native-vision-camera-face-detector
一個將 Google MLKit 與 Vision Camera 整合的 React Native 函式庫,提供即時與靜態影像的人臉偵測功能。
facebookresearch/detectron2
Detectron2 是由 Meta AI Research 提供的高性能電腦視覺程式庫,提供最尖端的物件檢測與分割演算法。
LazoVelko/neverclick
一款使用電腦視覺技術,讓使用者僅透過鍵盤即可執行滑鼠操作的桌面應用程式,旨在減少對實體滑鼠的需求。
dweep-desai/FaceGate-Mac
一款原生 macOS 應用程式鎖定工具,使用裝置端臉部辨識、Touch ID 或密碼來限制對特定應用程式的存取。
mne-tools/mne-python
一個開源的 Python 套件,用於探索、視覺化和分析人類神經生理資料,如 MEG 和 EEG。
egdels/makeacopy
一款注重隱私的離線 Android 文件掃描器,利用設備端機器學習與 OCR 技術,為自主主機工作流程建立可搜尋的 PDF。
krupkat/xpano
一款用於全景拼接的工具,可自動偵測影像群組並提供導出全解析度全景圖的投影調整功能
sceneview/sceneview
一個允許開發者使用 Jetpack Compose 和 SwiftUI 等聲明式 UI 框架,建構跨平台 3D 與 AR 沉浸式體驗的多平台框架。
blakeblackshear/frigate-hass-integration
一個將 Frigate 的 AI 驅動物件偵測與 NVR 功能連接到智慧家庭中心的 Home Assistant 結合,實現自動化安全監控。
perfanalytics/pose2sim
一種無標記的3D運動學工作流程,利用OpenSim將低成本攝影機拍攝的2D影片轉換為研究級3D關節角度與骨骼分析。
playcanvas/supersplat-viewer
一個高效率的網頁檢視器,支援使用 WebGPU 或 WebGL 在網頁中嵌入互動式 3D 高斯點陣場景。
microsoft/aurora
Aurora 是一個地球系統的基礎模型,透過將通用預訓練模型適應到特定預測任務,來預測溫度、空氣污染和海浪等大氣變數。
yatengLG/ISAT_with_segment_anything
一個互動式半自動影像分割標註工具,使用 Segment Anything Model(SAM)加速標記資料集的建立。
secluso/core
一個為 Raspberry Pi 設計的私有 DIY 家庭安全攝影機系統,透過端對端加密避免雲端監控。
mahmoodlab/TRIDENT
用於 AI 病理學中大規模全切片影像處理的工具包,提供使用多種基礎模型進行組織分割與特徵提取的端對端流程。
CERN/TIGRE
基於 Python 與 MATLAB 的 GPU 加速工具箱,支援廣泛的迭代演算法與靈活的 CT 幾何結構,實現快速且精確的 3D 體層重建
InsightSoftwareConsortium/ITK
一個用於 N 維科學影像處理、分割與配準的開源跨平台工具包,主要用於醫學影像分析。
mtalcott/google-photos-deduper
一款無需 OAuth 設定即可使用本地影像嵌入從 Google 相片資料庫中尋找並刪除重複照片的 Chrome 擴充功能。
Geekgineer/YOLOs-CPP
一個可投入生產的 C++ 推論引擎,為整個 YOLO 家族提供統一 API,支援從物件偵測到度量深度估計等多種任務。
alicevision/AliceVision
一個攝影測量電腦視覺框架,提供從無序照片或影片進行 3D 重建與相機追蹤的演算法。
chaofengc/IQA-PyTorch
一個基於 PyTorch 的影像品質評估(IQA)工具箱,提供大量全參考與無參考品質指標的 GPU 加速實作。
Babyhamsta/Aimmy
一款基於 AI 的瞄準輔助工具,使用 YOLOv8 和 DirectML 來幫助有身體或視覺障礙的玩家在 FPS 遊戲中提升準確度。
pur1fying/blue_archive_auto_script
一款利用YOLOv8進行角色檢測的自動化腳本,可自動完成《藍色檔案》中的戰鬥、日常任務和資源管理。
withoutbg/withoutbg-python
一個使用免費本地 ONNX 模型或專業雲端 API 來去除圖像背景的 Python 函式庫。
apple-aiml-research/ARKitScenes
透過移動LiDAR捕獲的室內場景大規模RGB-D資料集,為3D物體檢測和深度上採樣提供真實標籤。
lukasHoel/video_to_world
一種能夠解決影片擴散模型生成影片中幾何不一致性的3D重建流程,用於創建穩定的3D世界。
Slicer/Slicer
3D Slicer 是一個用於可視化與分析 3D 醫學影像資料的免費開源軟體套件。
qupath/qupath
QuPath 是一款開源的生物影像分析軟體,利用機器學習與專用演算法,提供對全切片與顯微鏡影像的註解與分析功能。
mudler/locate-anything.cpp
NVIDIA的LocateAnything-3B的C++/ggml推理移植版本,可在無需Python執行環境的情況下,於CPU與GPU上實現快速的開放詞彙物件檢測。
deepinv/deepinv
DeepInverse 是一個基於 PyTorch 的開源函式庫,旨在透過算子與演算法的模組化框架,利用深度學習解決成像逆問題。
Junjue-Wang/LoveDA
用於提升都市與鄉村環境中語意分割與域適應性能的高解析度遙測土地覆蓋資料集。
chenwei-zhao/captcha-recognizer
一種基於深度學習的套件,用於識別滑塊 CAPTCHA 中的缺口座標與置信度水平。
privatenumber/mac-ocr
macOS 命令列工具與 Node.js API,利用 Apple 的 Vision 框架從影像與 PDF 中提取文字,並建立可搜尋的 PDF,實現本地、私密的 OCR。
nsfw-filter/nsfw-filter
一款注重隱私的瀏覽器擴充,透過在裝置上執行 AI 來阻擋 NSFW 圖像,而無需將資料上傳至任何伺服器。