ruvnet/RuView
一個將無線電訊號轉化為空間智能的WiFi感知平台,實現無需攝影機的人員存在、生命徵象與姿態估計。
roboflow/supervision
一個電腦視覺工具包,為資料載入、視覺化和資料集管理提供與模型無關的構建模組,以加速視覺應用程式的開發。
immich-app/immich
具備 AI 驅動人臉辨識與 CLIP 基礎搜尋的高效能自托管照片與影片管理解決方案。
img2threejs/img2threejs
img2threejs 是一個以 Python 為後端支持的技能 (skill),讓 LLM 可以將單張參考圖轉換為程序化 Three.js 模型。它會建立一個 spec,執行受控的 vision‑review loop,並輸出 TypeScript code,利用 primitives 和 shaders 來重建重建物體,並隨時可以進行動畫製作。該系統可以透過 domain plugins (例如 CS2 武器皮膚) 進行擴展,並包含一個 live demo gallery。
baidu/Unlimited-OCR
用於複雜文件、PDF 與多頁影像的一次完成長距離解析的多模態 OCR 模型。
PaddlePaddle/PaddleOCR
PaddleOCR 是一個開源 OCR 與文件 AI 工具包,可將影像或 PDF 轉換為結構化、LLM 就緒的文本、表格與 Markdown/JSON。它提供多語言場景文字模型(PP-OCRv6)與輕量級視覺-語言模型(PaddleOCR-VL、PP-StructureV3),具備業界領先準確度、快速 CPU/GPU 推論能力,並支援從 Docker 到瀏覽器 SDK 的多種部署選項。與 Dify、RAGFlow 等 RAG 平台整合,可作為建構 AI 代理與檢索增強生成流程的資料引擎。
om-ai-lab/VLX-Seek
VLX‑Seek 是一個開源視覺-語言模型,可為邊緣設備代理執行細粒度感知。它生成區域提案,將每個區域編碼為特殊令牌,並讓語言模型透過選擇這些令牌來回答問題——從而為檢測、指代表達理解、OCR、計數和 VQA 生成緊湊、可解析的輸出。該倉儲包含推理程式碼、Python API 和 10 B 檢查點(權重託管於 Hugging Face 上)。
huawei-bayerlab/marigold-v2
Marigold V2 是一個研究程式碼庫,將預訓練的擴散變換器(Qwen‑Image‑Edit‑2509)重新用於快速、單步預測單眼深度、穿透深度、表面法線與反照率。它提供低成本微調(單一 32 GB GPU 上約 5 天)、最尖端基準測試結果、即用型推理/評估腳本,以及可擴展至新密集視覺任務的模組化 YAML 驅動訓練框架。
playcanvas/supersplat
一個基於瀏覽器的開源工具,用於檢視、編輯和優化 3D Gaussian Splats。
ultralytics/ultralytics
一個全面的電腦視覺框架,提供用於即時物件偵測、分割、分類和姿勢估計的 YOLO 模型。
blakeblackshear/frigate
一個與 Home Assistant 緊密整合的本地 NVR,為 IP 攝影機提供即時 AI 物件偵測。
julyx10/lap
適用於 macOS、Windows 與 Linux 的私有、本地優先照片管理工具,利用本地 AI 實現搜尋與人臉聚類,無需上傳至雲端。
viettranx/3dviz-pro-max
3Dviz Pro Max 是一個 AI 代理技能,讓大型語言模型能將自然語言描述轉化為完整的 Three.js 場景。它提供十步工作流程、223 個食譜目錄、22 個經驗證的 Three.js 套件藍圖、風格預設值,以及 Python 輔助工具,可在無頭 Chromium 中渲染場景、捕獲 PNG 畫格,並將觀察結果反饋給模型以優化。透過將 `skills/3dviz-pro-max/` 資料夾連結至 Claude Code 或 Codex 安裝,再使用 Vite 執行內建的 37 個可執行示範。專案採用 MIT 授權,專注於可重現、基於證據的 3D 可視化,而非聲稱每個食譜皆已完全渲染。
wilsjo2/OptiScaler-DLSSNR-PreSR-Multipass
一款利用 NVIDIA AI 增強支援遊戲中光照、細節與色彩的遊戲模組,提供可自訂的神經渲染效果。
ooolabdev/ooosplat
一個本地桌面應用程式,透過自動化的本地流程將環繞視野影片或影像序列轉換為 3D 高斯點雲模型。
amap-cvlab/ABot-Recon
ABot-Recon 是一個串流式 3D 重建系統,利用固定的 12 幀局部上下文,從長影片串流中建構全域軌跡與點雲,無需持久的長距離記憶。
MaaAssistantArknights/MaaAssistantArknights
一款基於影像辨識與 OCR 的明日方舟自動化助手,用於自動化日常任務、資源農場與基地管理。
gazijarin/itsgiving
一個即時網路攝影機應用,透過檢測面部表情和手勢來觸發匹配的迷因覆疊,支援在視訊會議中使用的虛擬攝影機。
facebookresearch/vggt-omega
VGGT-Omega 是一個電腦視覺模型,能從影像中預測相機姿態與深度,以實現3D場景重構。
ika-rwth-aachen/ros2-depth-anything-v3-trt
一個使用 Depth Anything V3 與 TensorRT 加速的 ROS 2 節點,用於即時度量深度估計與點雲生成。
tesseract-ocr/tesseract
Tesseract 是一個開源的 OCR 引擎和命令列工具,可將文字圖片轉換為超過 100 種語言的機器可讀文字。
StarTrail-org/PixelRAG
PixelRAG 將網頁、PDF 和影像渲染為截圖塊,使用視覺-語言模型嵌入,並建立 FAISS/Qdrant 向量索引,提供可搜尋的 API(或 Claude 插件),讓 LLM 能根據視覺佈局而非純文字來檢索資訊。
harry7557558/spirula-studio
一個獨立的 3D Gaussian Splatting 流程,無需 Python、PyTorch 或 COLMAP 即可將照片和影片轉換為 3D 模型。
hacksider/Deep-Live-Cam
一款即時人臉交換與深度偽造工具,僅需一張來源影像即可替換影片或即時網路攝影機畫面中的人臉。
agamrossen/VolAnti
一種透過螺旋槳的諧波聲音而非無線電信號來識別多旋翼無人機的開源聲學無人機偵測系統。
ace-trump-tech/DeltaForce-OBS-Locker
基於YOLOv14的即時物件偵測與目標鎖定系統,可過濾環境誤報,精準識別Delta Force遊戲中的角色
ocrmypdf/OCRmyPDF
一個命令列工具,為掃描 PDF 添加 OCR 文字層,使其可搜尋且可複製貼上,同時保持影像品質。
colmap/colmap
COLMAP 是一個開源的結構從運動(SfM)與多視角立體(MVS)管道,可自動將照片集合轉換為 3D 模型。它提供 GUI、命令列工具、Python 繫結、GPU 加速特徵提取,以及跨平台二進位檔,是電腦視覺、機器人、AR/VR 及任何需要相機位姿與密集場景幾何的流程中,研究與應用的首選基礎工具。
Robbyant/lingbot-map
LingBot‑Map 是一個前饋式 3D 重建模型,透過幾何上下文轉換器將影片畫格串流傳輸,並使用分頁式 KV 快取(FlashInfer)保持低記憶體用量。它在中等 GPU 上以約 20 fps 運行,支援透過關鍵畫格間隔或視窗化推論處理極長序列,並附帶可直接執行的示範、離線批次渲染器,以及 HuggingFace/ModelScope 上的預訓練檢查點。
opencv/opencv
OpenCV 是一個開源的電腦視覺程式庫,提供用於人工智慧和視覺感知開發的工具與演算法。
RapidAI/RapidOCR
一款將 PaddleOCR 模型轉換為 ONNX 格式的開源 OCR 工具,可在多個平台與語言中實現快速、低資源消耗的離線部署。
roboflow/rf-detr
RF‑DETR 是一個基於 DINOv2 骨幹網絡的即時 Transformer 基礎視覺模型套件(檢測、分割、關鍵點),以 `rfdetr` Python 套件形式發行,提供多種尺寸變體(Nano‑2XL),核心部分採用 Apache‑2.0 授權,XL/2XL 採用 PML 1.0 授權。包含在 COCO 和 RF100‑VL 上展示最尖端準確度-延遲權衡的基準測試表格。安裝方式為 `pip install rfdetr`;使用方式為單行 `model.predict(...)`,並可選使用 `supervision` 套件進行可視化。專案還提供 Roboflow 平台上的 NAS 流程,用於自訂架構搜尋。
facebookresearch/sam3
SAM 3(帶概念的分割一切)是 Meta 的 8.48 億參數基礎模型,允許您使用自由形式文字(或視覺範例)提示影像或影片,並為所有匹配物件返回掩碼、邊界框與分數。它結合了 DETR 風格檢測器與 SAM 2 風格追蹤器,引入用於細粒度提示區分的存在性標記,並在超過 400 萬個自動標註概念上訓練。該倉儲提供安裝步驟、範例筆記本與用於評估的新 SA‑CO 基準(27 萬個概念)
cvat-ai/cvat
一個用於為電腦視覺構建高品質視覺數據集的開源數據標註平台,支持圖像、影片和 3D 標註。
aoguai/LiYing
一款使用 AI 處理人臉檢測、背景替換和佈局安排,以製作專業級證件照的自動化證件照處理工具。
jeremyipark/vision-demos
vision‑demos 是一組四個具體的 Python 示範,將最先進的姿態估計(`vitpose-plus-large`)和分割(`sam3.1`)模型應用於日常活動——舞蹈同步、引體向上計數、抱石路線分析和跑步步頻測量。每個示範都包含 README、設定說明和視覺範例,整個儲存庫在 Apache‑2.0 授權下發布。
deepinsight/insightface
一個提供用於人臉識別、檢測與對齊的最先進演算法的開源 2D 與 3D 深度人臉分析工具箱。
ultralytics/yolov5
YOLOv5 是由 Ultralytics 開發、基於 PyTorch 的開源物件偵測/分割/分類模型套件,提供多種模型大小、簡單的 Python/CLI 推論、單行指令訓練,以及可匯出至多種部署格式。
yakhyo/uniface
UniFace 是一個 Python 函式庫,將 15 種人臉分析任務——偵測、關鍵點、3D 網格、解析、遮罩、注視、頭部姿勢、人口統計、情緒、品質、防偽、識別、匿名化以及基於 FAISS 的相似度比對——整合進一個單一、易於安裝的套件中(支援 CPU、Apple Silicon 或 CUDA)。它提供一致的 API、自動下載經驗證的模型權重,並包含豐富的文檔、Notebooks 以及社群 Discord。
oncologylab/histopia
一種用於連續切片組織學與蛋白質體影像分析的計算研究工具,支援跨組織切片的三維重建與空間拓撲分析。
MrNeRF/LichtFeld-Studio
一個模組化的工作站,整合了訓練、即時視覺化、編輯與匯出功能於單一原生應用程式中,適用於 3D Gaussian Splatting。
jayin92/Skyfall-GS
Skyfall-GS 是一個框架,透過結合衛星影像提供的幾何資訊與 diffusion 模型產生高品質紋理,合成大規模、沉浸式的 3D 城市場景。
ArthurBrussee/brush
一個基於 WebGPU 與 Burn 框架的跨平台 3D 重建引擎,支援 macOS、Windows、Linux、Android 與瀏覽器。
serengil/deepface
一個輕量級的 Python 框架,用於臉部辨識和臉部屬性分析,整合多個先進模型,進行身份驗證和人口統計預測。
pq-yang/MatAnyone2
一種在真實世界條件下具有高穩健性、能保留頭髮與邊緣等細節的影片人物馬賽克框架,用於從影片中提取人物。
facebookresearch/boxer
Boxer 是一個利用帶姿態影像與半稠密點雲,將開放世界 2D 物件檢測提升為室內場景 3D 方向邊界框的系統。
ByteDance-Seed/Depth-Anything-3
一種使用統一深度-射線表示,從單張或多張影像中預測空間一致的 3D 幾何、深度圖與相機姿態的模型。
microsoft/OmniParser
一種將 GUI 截圖轉換為結構化元素的螢幕解析工具,使視覺基礎 AI 代理能夠準確識別並操作介面元件。