MITK/MITK
一個開源的 C++ 工具包,透過結合 ITK 和 VTK,用於開發互動式醫學影像處理軟體。
NeoGeographyToolkit/StereoPipeline
NASA 開發的一套開源自動化地理測量與立體攝影測量工具,用於將立體影像處理為 3D 地形模型與地圖製圖產品。
savvasdalkitsis/uhuruphotos-android
一個開源的 Android 媒體畫廊,提供注重隱私的 Google 相簿替代方案,支援透過 LibrePhotos 伺服器實現 AI 驅動的搜尋與人臉辨識。
soruly/trace.moe
使用影像向量搜尋識別截圖的特定動畫、集數與時間戳的動畫場景搜尋引擎。
gowvp/owl
一個將 GB28181、ONVIF 與 RTSP 流統一至單一瀏覽器管理介面的開源網路影片平台,支援 AI 告警功能。
flatironinstitute/CaImAn
用於大規模鈣成像與電壓成像資料分析的可擴展 Python 工具箱,提供用於運動校正、源提取與脈衝去捲積的可擴展演算法。
ros-perception/image_pipeline
一個將原始相機影像處理為機器人高階視覺處理可用格式的ROS 2套件。
nguyenq/tess4j
Tess4J 是 Tesseract OCR API 的 Java JNA 包裝器,可讓開發者從各種影像格式和 PDF 文件中提取文字。
aws-samples/amazon-textract-textractor
一個簡化使用 Amazon Textract 從文件中提取文字、表格、表單與身分資料的 Python 套件。
yo-WASSUP/Good-GYM
一個使用 RTMPose 進行即時姿勢偵測,並透過網路攝影機自動計算運動次數的 AI 健身助理。
TissueImageAnalytics/tiatoolbox
基於 PyTorch 的計算病理學工具箱,提供從資料載入到視覺化的端對端 API。
LSH9832/edgeyolo
EdgeYOLO 是一款無錨點的目標檢測器,針對 Nvidia Jetson 等嵌入式邊緣設備的即時效能進行優化,支援包括 TensorRT 與 RKNN 在內的多種部署格式。
deltacv/VisionGraph
一個用於建立與原型化 OpenCV 算法的視覺化節點編輯器,支援即時流程預覽。
apple-aiml-research/ml-fastvit
一種利用結構重參數化的快速混合視覺轉換器,可在行動裝置上實現低延遲影像分類。
shaoshengsong/DeepSORT
一個以 C++ 寫成的即時多物件追蹤系統,使用 YOLO 與 ONNX Runtime 實作 ByteTrack、OC-SORT、Deep OC-SORT 與 DeepSORT。
apple-aiml-research/ml-mobileone
MobileOne 提供五種超快速 CNN 主幹(S0-S4)的 PyTorch 實作,在 iPhone 12 Pro 上可達 ≤ 2 毫秒延遲下 71–79% 的 ImageNet Top-1 準確率。該程式碼庫包含訓練就緒與推論就緒的檢查點、用於裝置部署的 CoreML 模型,以及 iOS 基準測試應用(ModelBench)。透過重參數化,訓練時的分支在推論時會融合為單一快速網路。
apple-aiml-research/ml-matrix3d
Matrix3D 是一個統一的攝影測量模型,可執行姿態估計、深度預測與新視角合成,從單張或少量無姿態影像實現3D重構。
cvignac/DiGress
使用 Graph Transformer 架構的離散去噪擴散模型,用於生成合成圖和分子結構。
EasyLive2D/relive2d
Live2D 原生 SDK 的 Python 封裝,可直接使用 OpenGL 載入與渲染 Live2D 模型,無需 Web 引擎。
HZAI-ZJNU/Mamba-YOLO
Mamba YOLO 是一種物件檢測基線,以狀態空間模型取代傳統架構,為即時檢測提供高效替代方案。
fieldtrip/fieldtrip
支援多種硬體格式與源重建的 MEG、EEG 和 iEEG 資料高階分析 MATLAB 工具箱。
sgoldenlab/simba
SimBA是一款基於GUI的工具包,讓研究人員無需程式技能即可訓練監督式機器學習分類器,自動檢測與量化從姿態估計影片資料中提取的動物行為。它將原始追蹤資料轉化為經過驗證的行為分類與豐富的後續分析,支援行為神經科學研究。
ecmwf-lab/ai-models
一個用於執行基於 AI 的氣象預測模型的命令列工具,提供統一的介面以進行資料取得與模型執行。
isl-org/Open3D-ML
Open3D 的擴充,提供用於 3D 機器學習任務(如語義分割與物件檢測)的工具、預訓練模型與管道。
ANTsX/ANTs
一個用於高維醫學影像配準與分割的 C++ 庫,用於跨物種與器官系統分析腦結構與功能。
MiniAiLive/Android-FaceRecognition
用於安全與金融科技應用中防止偽造的 Android SDK,支援人臉辨識與 3D 被動式活體檢測。
supervisely/supervisely
Supervisely 是一個基於 Web 的電腦視覺平台,結合了數據標註、模型訓練、推理與協作工具。它提供用於自動化的 Python SDK 與 REST API,以及一個開發者可以建立無介面腳本、互動式 UI 工具或標註工具擴充功能並一鍵部署的應用生態系統。
PozzettiAndrea/ComfyUI-DepthAnythingV3
整合 Depth Anything V3 的自訂 ComfyUI 節點,實現高品質深度估計、3D 點雲重構與一致影片深度映射。
sh4den/Montscan
一個自動化文件處理器,透過 Ollama 使用本地 Vision AI 來分析掃描的 PDF,並自動以具描述性的檔案名稱重新命名。
cosanlab/py-feat
一個用於面部表情研究的 Python 工具箱,可從影像與影片中偵測人臉並提取情緒、面部肌肉運動與關鍵點。
Zyphra/zuna
ZUNA1.1 是一個用於 EEG 的開源基礎模型,利用 3D 頭皮座標實現訊號去噪、缺失通道重建與稀疏電極佈局的上採樣。
Pixel-Talk/PEAR
PEAR 是一個即時框架,能從影像或影片中以 100 FPS 預測富有表現力的 3D 人體網格參數。
scu-zjz/IMDLBenCo
提供影像篡改檢測與定位的全面基準與模組化程式碼庫,包含標準化元件與最尖端模型實作。
Mengqi-Lei/count-anything
Count Anything 是一種基於自然語言查詢在影像中計數物件的研究模型。它透過結合稀疏區域計數器與密集像素計數器,並以無參數融合步驟整合結果,在六個領域(場景、衛星、醫學等)中跨域運作。該倉庫提供預訓練檢查點、訓練/評估腳本,以及大型 CLOC 資料集的準備說明。
Intellindust-AI-Lab/EdgeCrafter
EdgeCrafter 提供專為邊緣裝置優化之緊湊視覺變換器(ViTs),在低延遲下實現高效率的物件檢測、實例分割與姿態估計。
ultralytics/xview-yolov3
一種專為在 xView 衛星影像資料集上進行遙測應用的物件偵測訓練與執行而設計的 YOLOv3 特化實作。
mlmed/torchxrayvision
一個用於胸部 X 光資料集與模型的函式庫,提供預訓練模型以及統一介面,以便在多個公開胸部 X 光資料集上工作。
tschnz/Live-Video-Magnification
一種使用 Eulerian video magnification 技術,即時放大微小運動與顏色變化的影片放大工具。
lightly-ai/lightly-studio
一個使用嵌入來幫助使用者高效管理與標記影像與影片資料的本地為先資料整理與標記工具。
dog-qiuqiu/FastestDet
一個超輕量、無錨點的即時物件偵測演算法,針對 ARM CPU 與嵌入式裝置的高速推論進行最佳化。
open-edge-platform/dlstreamer
一個基於 GStreamer 和 OpenVINO 的媒體分析框架,可在 Intel CPU、GPU 和 NPU 上實現硬體加速的影片與音訊智慧流程。
xrdevrob/QuestCameraKit
一組適用於 Meta Quest 3/3S 的 Unity 範例,支援透過物件檢測、QR 碼追蹤與多模態 AI 來理解周遭環境,打造混合實境體驗。
torch-points3d/torch-points3d
一個用於3D分類、分割與檢測的點雲分析深度學習框架,提供高階API與一系列先進模型庫。
BGU-CS-VIL/WTConv
一個實現小波卷積的函式庫,為 CNN 提供大感受野,並配備針對 CUDA、Metal 和 Triton 優化的後端。
reall3d-com/Reall3dViewer
基於 Three.js 的 Web 渲染器,支援大規模 3D 高斯點雲的高效率串流傳輸與自適應 LOD。
cre185/InstantSfM
一種 GPU 原生的結構從運動(SfM)流程,可加速從 2D 圖像重建 3D 結構的過程,包括對 3D 高斯點雲(3DGS)的整合支援。
ilastik/ilastik
用於分割、分類、追蹤和計數細胞及其他實驗影像資料的互動式機器學習工具包。
Ma-Zhuang/OmniNWM
OmniNWM 是一個研究用程式碼庫,建構用於自動駕駛模擬的全景多模態世界模型。它從車輛軌跡聯合生成 RGB、語意、深度與 3D 佔用圖,使用歸一化 Plücker 射線圖實現精確控制,並提供基於佔用的密集獎勵以支援封閉迴路策略評估。該倉儲包含安裝步驟(含對 `transformers` 的手動修補)、nuScenes 資料準備說明、預訓練檢查點下載連結,以及用於推論、分布外測試與分階段訓練的腳本。