ucam-eo/tessera

TESSERA 是一個開源地理空間基礎模型,可將受雲層干擾的衛星時序數據轉換為用於全球地球表示和分析的緊湊型 128 維嵌入。

lucidrains/vit-pytorch

一個全面的 PyTorch 庫,實現了原始 Vision Transformer (ViT) 及其數十種架構變體,用於影像分類。

aqlaboratory/openfold-3

AlphaFold3 的開源重現,用於預測蛋白質、RNA、DNA 和小分子的三維結構。

Project-MONAI/MONAI

一個基於 PyTorch 的開源框架,用於醫療影像領域的深度學習,提供針對醫療資料的標準化工作流程與領域專用工具。

opendatalab/OmniDocBench

一個用於評估真實場景中文檔解析的綜合性基準,包含版面檢測、OCR、表格和公式識別的豐富標註。

LibreYOLO/libreyolo

一個 MIT 授權的電腦視覺套件,提供檢測、分割、姿態、深度、OCR 及其他視覺任務的單一 API,並包含訓練與匯出工具。

nv-tlabs/vipe

一款從原始影片(包括廣角與 360 度全景影片)中估計相機姿態、內參與密集深度圖的空間 AI 工具。

aiptimizer/TurboOCR

一個高速的 GPU 文件解析器,能將影像與 PDF 轉換為結構化 Markdown,包含表格與公式,使用 C++、CUDA 與 TensorRT。

mkturkcan/DART

一個免訓練框架,利用 TensorRT 優化與蒸餾主幹,將 SAM3 轉換為即時多類別開放詞彙偵測器。

TickLabVN/biopass

一個為 Linux 設計的多模態生物辨識登入系統,支援臉部與指紋認證,具備 AI 驅動的防偽功能與圖形化管理介面。

leeyeel/Sketch2Motion

一個將靜態影像或草圖轉換為平滑繪製動畫的工具,透過轉換為 SVG 並使用 Manim 渲染。

opencv/opencv-python

無需手動編譯即可透過 pip 安裝的 OpenCV 預先建置 Python 綁定。

pytorch/vision

一個為電腦視覺提供熱門數據集、模型架構與影像轉換的 PyTorch 函式庫。

mindee/doctr

一個基於 PyTorch 的 OCR 套件,提供 PDF 與影像中文字檢測與識別的無縫流程,支援佈局與表格分析。

fabiotosi92/ZipDepth

ZipDepth 是一個 6 M 參數的零樣本單目深度模型,可在 GPU 上以 >1 k FPS 的速度運行,並可導出至移動執行時。它結合了 RepVGG 風格的可重參數化卷積、條帶池化注意力與輕量級 FPN 解碼器。該倉儲提供即用型推理腳本、ONNX/TorchScript 導出工具、基準測試以及完整的訓練流程(從 Depth Anything V2 知識蒸餾而來)。

qpuchen/nnUNet_att_position_correction

一種半監督式 3D 牙齒分割框架,透過引入軸向注意力機制(axial attention)與位置修正模組來增強 nnU-Net,旨在利用有限的標記數據來提升準確度。

mitsuba-renderer/mitsuba3

一個面向研究、可微分的渲染系統,用於正向和反向光傳輸模擬,並具有深度的 Python 整合。

obss/sahi

SAHI(Slicing‑Aided Hyper Inference)是一個開源 Python 套件,可於極大影像或影片上執行切片推論,支援物件檢測與實例分割。它相容於大多數主流檢測器(YOLO、MMDetection、Detectron2、HuggingFace、TorchVision 等),提供 CLI 與 Python API,整合 FiftyOne 進行可視化,並包含 COCO 資料集處理與評估的實用工具。

Zarxrax/Sammie-Roto-2

一款使用 SAM2 和 MatAnyone 等模型進行 AI 輔助影片遮罩、分割和物件移除的跨平台桌面應用程式。

WebODM/OpenSplat

OpenSplat 是 3D 高斯點陣圖的 C++ 實作,能將 COLMAP/OpenSfM/ODX/nerfstudio 資料轉換為基於高斯函數的緊湊場景檔案。支援 CUDA、ROCm(HIP)、Apple Metal 和純 CPU 建置,提供 Docker 映像,並提供簡單的 CLI 用於訓練、續訓、遮罩與匯出至 .ply/.splat/.spz/.rad 格式。

AprilRobotics/apriltag

一種用於機器人的視覺標記系統,可在影像中偵測獨特標記,提供精確識別與3D姿態估計。

GunduLabs/gaze

一個面向Linux的人臉認證系統,提供裝置端人臉辨識和PAM整合,實現安全、無密碼登入和sudo存取。

Farama-Foundation/ViZDoom

一個基於 Doom 的 AI 研究平台,用於開發和測試僅使用視覺資訊玩遊戲的機器人,主要用於強化學習研究。

roboflow/inference

一個推理引擎和部署平台,使用戶能夠在任何硬體上運行電腦視覺模型和複雜的視覺工作流程,從邊緣設備到雲端。

jacobgil/pytorch-grad-cam

一個用於電腦視覺中可解釋人工智慧(XAI)的 PyTorch 函式庫,提供廣泛的像素歸因方法,用於視覺化與診斷模型預測。

SimonZeng7108/efficientsam3

利用知識蒸餾壓縮視覺與文字編碼器的 SAM3 輕量版本,模型大小最多減少 90%,實現高效分割。

Tau-J/rtmlib

rtmlib 是一個輕量級 Python 庫,用於人體與動物姿態估計,封裝了 RTMPose 與 ViTPose 模型。它避開了重型 OpenMMLab 依賴,僅需 numpy、OpenCV 與 ONNX Runtime(支援可選 GPU/加速器後端)。該套件提供高階解決方案類別(Wholebody、Body、Hand、Animal、Custom、Wholebody3d),結合檢測器(YOLOX、RFDETR、RTMDet)與姿態估計器,並附帶骨架繪製工具。模型可自動從 OpenMMLab 或 HuggingFace 鏡像下載。可透過 pip 或原始碼安裝,並執行 Gradio WebUI 或使用 Python API 進行單圖、影片或攝影機推論。

1038lab/ComfyUI-RMBG

一套用於進階影像背景移除與精確物件分割的 ComfyUI 自定義節點套件,使用了如 RMBG-2.0 和 SAM2 等多種 AI 模型。

prs-eth/LitePT

LitePT 是一種輕量級、高性能量的 3D 點雲架構,在保持 3D 視覺任務最先進準確度的同時,大幅減少參數數量與記憶體佔用。

deepfakes/faceswap

一個透過「擷取‑訓練‑轉換」流程,使用深度學習辨識與交換圖片與影片中臉孔的工具。

Udayraj123/OMRChecker

一款開源的 OMR 檢查軟體,利用電腦視覺技術準確讀取與評估掃描的 OMR 表格或手機照片,並將結果匯出為 CSV。

margelo/react-native-vision-camera

一款為 React Native 提供專業級照片/影片拍攝與即時 AI 幀處理能力的高效能相機庫。

koide3/small_gicp

專為高速 3D 對齊設計的高效率、平行化 C++ 庫,支援 ICP、GICP、VGICP 等精細點雲配準。

KennethJAllen/proper-pixel-art

一種將雜訊多、高解析度的像素藝術風格影像與動畫,透過恢復底層網格,轉換為乾淨、真實解析度像素資源的工具。

MIT-SPARK/VGGT-SLAM

一個用於 3D 地圖構建與定位的即時、稠密前饋式場景重建系統,並具備可選的開放集 3D 物件偵測功能。

roflcoopter/viseron

專為家庭與辦公室監控設計的自托管、僅限本地運行的 NVR 與 AI 電腦視覺軟體,支援物件與人臉辨識。

bhimrazy/receipt-ocr

一個使用 Tesseract 和 LLM 從收據影像中提取原始文字或結構化 JSON 資料的 OCR 引擎。

Yuliang-Liu/MonkeyOCR

MonkeyOCR 是一個文件解析模型,它使用 Structure-Recognition-Relation(結構-識別-關係)三元組範式將 PDF 和圖像轉換為結構化的 Markdown,支援英文和中文。

Tencent-Hunyuan/HunyuanOCR

一個輕量級、端對端的 OCR 視覺語言模型,透過指示性解碼實現快速結構化文字提取

VisoMasterFusion/VisoMaster-Fusion

一款用於圖像、影片和即時網路攝影機畫面進行 AI 換臉與增強的桌面應用程式,具備專業編輯工具與 GPU 加速功能。

nilearn/nilearn

Nilearn 是一個使用統計和機器學習工具分析腦部體積與表面的 Python 函式庫,並利用 scikit-learn 進行多變量統計分析。

Topdu/OpenOCR

一個開源工具包,提供輕量級模型,實現統一的文本、公式與表格識別以及文件解析。

NVlabs/SOMA-X

SOMA‑X 是一個 Python 函式庫,提供參數化人體和手部的統一可微分表示,支援多種身份模型(MHR、SMPL‑X、MANO 等),並透過 NVIDIA Warp 提供快速蒙皮。它包含用於不同細節層級全身和手部網格的 `SOMALayer` 和 `SOMAHandLayer`,以及姿態逆解、綁定控制和資料 I/O 工具,使其適用於動畫、姿態估計擬合和合成資料產生。

zs1083339604/FaceWinUnlock-Tauri

一款利用 OpenCV 和自訂憑證提供程式,使無原生 Windows Hello 硬體的裝置也能實現人臉辨識解鎖的 Windows 工具。

AmmarkoV/SAM3DBody-cpp

一個無需 Python 依賴的獨立 C++ 推論引擎,可從 2D 圖像中回歸 SAM-3D-Body 的 3D 人體姿態、形狀與相機參數。

roboflow/sports

一個用於運動分析的電腦視覺工具與數據集集合,專注於球類追蹤、球員重識別與球衣號碼 OCR 的挑戰。

SharpAI/DeepCamera

一個開源的 AI 相機平台,能在本地部署 VLM 場景分析與物件偵測技能,並具備自動化、硬體感知的安裝方式。

phongdaot/MocapAnything

一個端對端的動作捕捉系統,可將單目影片轉換為任意骨骼(包括動物與自訂綁定)的 3D 關節旋轉。