google-research/scenic
一個基於 JAX 與 Flax 的電腦視覺研究函式庫,提供可擴展的函式庫與專案範本,用於開發跨影像、影片與音訊的注意力模型。
kotaro-kinoshita/yomitoku
專為日文文件影像提供高精度 OCR、版面分析與表格結構識別的文件 AI 引擎。
zju3dv/InfiniSplat
InfiniSplat 是一種用於大基線單目視角合成的系統,能夠從單張 RGB 影像或 RGB-深度對中重建 3D 高斯點雲場景。
SarahWeiii/CoACD
一個將複雜形狀分解為近似凸包的3D網格分解工具,用於實現高效的碰撞檢測與物理模擬。
playcanvas/splat-transform
SplatTransform 是一個開源的程式庫與 CLI,可用於轉換、編輯和分析 3D 高斯點雲資料。支援多種輸入/輸出格式(PLY、SOG、SPZ、GLB、HTML、體素、WebP 等),提供幾何變換、過濾、簡化、LOD 串流、碰撞網格產生以及 GPU 加速運算。可透過 npm 安裝(或使用 Docker 後端),執行如 `splat-transform input.ply output.sog` 的指令,或串連動作(-s、-t、--filter-box、--decimate)。適合從事神經圖形點雲表示的研究人員、引擎開發者與內容創作者。
PiTracLM/PiTrac
一款開源的 DIY 高爾夫擊球監測器,使用 Raspberry Pi 和機器學習來追蹤擊球速度、角度和旋轉。
twistedfall/opencv-rust
OpenCV 電腦視覺庫的 Rust 綁定,讓開發者能在 Rust 中使用 OpenCV 的影像處理與 CV 工具。
davnords/LoMa
LoMa 是一組用於電腦視覺的快速、精確的局部特徵匹配器 — 它能高效地在影像對之間找到對應點,可作為 3D 重構和視覺定位流程中 LightGlue 的即插即用替代品,提供多種模型尺寸以平衡速度與準確性。
duy-phamduc68/TrafficLab-3D
一個端到端的交通分析套件,利用電腦視覺與自訂校準流程,從 CCTV 影像與衛星地圖生成 3D 數位雙生。
suzuran0y/CCTV-Smartphone-AI-Monitoring
Sentinel 是一個開源的僅限區域網路系統,可將 Android 手機轉換為即時攝影機節點,並讓 Python/Flask PC 伺服器成為即時預覽、分段錄製與 AI 觸發監控儀表板。它透過運動偵測呼叫外部視覺模型,輸出結構化 JSON 事件,並將所有資料本地化,適用於注重隱私的監控或資料收集研究。
NVlabs/SpatialClaw
SpatialClaw 是一個免訓練、以程式碼為行動的空間推理代理框架。VLM 在預載感知工具(SAM-3、Depth-Anything-3)與科學庫的持續性 Jupyter 內核中撰寫並執行 Python 細胞。系統循環執行規劃、程式碼產生、安全檢查執行與觀察,直到代理回傳答案。在 20 個基準上評估,平均準確率達 59.9%,比先前代理高出 11.2 點,且在六個 VLM 後端上使用相同的提示與工具。倉儲提供完整執行環境、基準載入器、安裝指令碼與 SLURM 支援。
Dicklesworthstone/franken_ocr
franken_ocr 是一個純 Rust、僅 CPU 的 OCR 引擎,可執行百度的 Unlimited-OCR 及四個相關視覺-語言模型。它以單一可移植二進位檔(`focr`)形式發行,一次模型下載後即可完全離線運作,並提供 Markdown、JSON、圖表資料與 MusicXML 輸出。專案使用手寫 SIMD 內核,除經審核的 SIMD 島外禁止使用 unsafe Rust,並包含廣泛的自檢與發布認證腳本。
manycoretech/aholo-viewer
使用分塊串流 LOD 的高性能 3D 高斯潑濺與網格渲染器,可處理龐大的 3D 資料集。
opencv/opencv_contrib
這是一個用於 OpenCV 實驗性及社群貢獻額外模組的儲存庫,作為這些功能移至官方核心發行版之前的測試場。
PointCloudLibrary/pcl
一個大型開源函式庫,用於 2D/3D 影像與點雲處理,廣泛應用於機器人與 3D 感知領域。
robertknight/ocrs
一個使用神經網路模型從影像中提取文字的 Rust 庫與 CLI 工具,旨在極大程度減少影像前處理的需求。
DeepLabCut/DeepLabCut
DeepLabCut 是一個無需標記的姿態估計工具箱,允許研究人員使用深度學習在影片中追蹤動物和物體,而無需使用物理標記。
infinitered/nsfwjs
一個使用 TensorFlow.js 在客戶端對影像進行分類,以識別安全與 NSFW 內容的 JavaScript 庫。
antvis/chart-visualization-skills
透過可搜尋的技能目錄、CLI、HTTP 服務與 npm 套件,讓 LLM 能生成精確、可直接執行的圖表(G2、G6、X6、資訊圖、敘事文字等)的 AI 增強型 AntV 技能庫。
MIT-SPARK/KISS-Matcher
一種快速且穩健的點雲配準庫,用於對齊 3D 點雲以確定相對旋轉與平移。
MIC-DKFZ/nnInteractive
專為醫學影像設計的先進 3D 可提示分割框架,支援透過點、塗鴉與套索提示來優化體積遮罩。
TencentARC/Track4World
Track4World 是一個用於單眼影片中每個像素的密集 3D 追蹤的框架,以前饋方式提供以世界為中心的 3D 場景光流估計。
UVA-Computer-Vision-Lab/OmniShotCut
一種使用 Shot-Query Transformer 來識別跨多種影片來源的切口與轉場的高性能鏡頭邊界檢測工具。
kocasariumut/FaceAnything
Face Anything 是一個前饋神經模型,能從任何圖像序列或單張照片重建構建時間一致的 4D (3D + 時間) 人臉,並輸出點雲影片、深度/法線圖、標準座標視覺化、逐幀 PLY 網格和相機數據。它在 CUDA GPU 上運行,可透過單行腳本安裝,並提供可配置的處理模式和背景移除功能。
ssrajadh/sentrysearch
一款語意影片搜尋工具,可透過自然語言或影像查找特定事件,並自動剪裁匹配的影片片段。
roflcoopter/viseron
專為家庭與辦公室監控設計的自托管、僅限本地運行的 NVR 與 AI 電腦視覺軟體,支援物件與人臉辨識。
nvpro-samples/vk_gltf_renderer
一個 Vulkan RTX 路徑追蹤器和 glTF 場景編輯器,作為 glTF 2.0 和 2.1 場景的高保真 PBR 材質參考。
RollingPlain/IVIF_ZOO
紅外線與可見光影像融合(IVIF)的綜合性資源中心與基準,提供精選資料集、分類融合方法目錄與評估工具。
Pointcept/Utonia
一種用於3D點雲的跨域預訓練 Point Transformer V3 編碼器,為各種下游3D感知任務提供通用表示。
fegennari/3DWorld
具備宇宙、城市與地形的廣泛程序化生成,以及大規模模型高效能渲染的跨平台 OpenGL 3D 遊戲引擎
google/ffn
一種針對腦組織電子顯微鏡資料集中的大型複雜3D形狀實例分割的神經網路框架。
Artoriuz/ArtCNN
一組專為放大與清理動畫內容而優化之單一影像超解析度模型,提供即時與高品質非即時兩種選項。
hybridgroup/gocv
GoCV 為 OpenCV 4 提供 Go 語言綁定,使 Go 開發者能在其應用程式中整合先進的電腦視覺與硬體加速影像處理功能。
microsoft/GlobalMLBuildingFootprints
Microsoft的全球建築輪廓倉儲發布了一個超過10億個建築的開放授權資料集,包含多邊形輪廓(以及大量高度估計值),由深度學習分割模型生成。資料以gzip壓縮的行分隔GeoJSON檔案形式提供,按Bing四叉樹鍵索引,附帶置信度分數和文件,適用於大規模GIS或AI驅動的城市分析。
tue-mps/eomt
一種僅使用普通 Vision Transformer (ViT) 的編碼器-only 圖像分割模型,無需複雜解碼器,實現高速與高準確度。
automeris-io/WebPlotDigitizer
WebPlotDigitizer 是一款透過電腦視覺輔助,為研究人員與科學家從數據視覺化圖像中提取數值數據的工具。
cvg/resplat
ReSplat 是一種前饋遞迴模型,用於 3D 高斯點雲,透過渲染誤差作為反饋,迭代優化場景表示。
mikel-brostrom/boxmot
一個可插入的多物件追蹤框架,提供統一介面以整合各種檢測器與追蹤器,支援軸對齊與方向邊界框。
ok-oldking/ok-script
基於電腦視覺的 Python 自動化框架,適用於 Windows 應用、遊戲與 Android 裝置,支援 OCR 與模板比對。
QIN2DIM/hcaptcha-challenger
結合電腦視覺模型與多模態大語言模型的AI驅動工具,用於解決hCaptcha挑戰。
vccimaging/DeepLens
一個可微分的光學鏡頭模擬器,用於計算成像與光學設計,允許鏡頭作為 PyTorch 訓練迴圈中的可學習參數進行最佳化。
princeton-vl/infinigen
一個用於為電腦視覺和機器人模擬創建無限逼真 3D 世界、室內場景和關節式資產的程序化生成引擎。
Peterande/D-FINE
D‑FINE 是一個即時物件檢測框架,將 DETR 的框回歸重新定義為細粒度分佈精煉,並加入自蒸餾模組。它提供多種模型尺寸(‑N 至 ‑X),在 T4 GPU 上以 70–470 FPS 運行,同時達成最尖端的 COCO/AP 分數(42.8 %–55.8 %),且無額外推論成本。倉儲提供 COCO、Objects365 及自訂 COCO 格式資料集的預訓練檢查點、設定檔與完整的訓練/評估腳本。
PozzettiAndrea/ComfyUI-MotionCapture
一個使用 GVHMR 從影片中提取 3D 人體運動與 SMPL 骨骼參數的 ComfyUI 自訂節點套件。
apple-aiml-research/ml-depth-pro
一種可在不到一秒內生成高解析度、清晰度高的絕對尺度深度圖的零樣本單目度量深度估計基礎模型。
dynobo/normcap
適用於 Linux、macOS 與 Windows 的 OCR 驅動螢幕截圖工具,可從螢幕提取文字與條碼,而非儲存影像。
koide3/direct_visual_lidar_calibration
一種無需靶標、自動化的LiDAR-相機外參校準工具箱,利用環境結構與紋理實現精確的感測器對齊。
localai-org/depth-anything.cpp
一個無依賴的 C++ 封裝,用於在 CPU 與 GPU 上快速進行單目度量深度與相機位姿推論,支援 Depth Anything 3 與 V2。