img2threejs/img2threejs

img2threejs 是一個以 Python 為後端支持的技能 (skill),讓 LLM 可以將單張參考圖轉換為程序化 Three.js 模型。它會建立一個 spec,執行受控的 vision‑review loop,並輸出 TypeScript code,利用 primitives 和 shaders 來重建重建物體,並隨時可以進行動畫製作。該系統可以透過 domain plugins (例如 CS2 武器皮膚) 進行擴展,並包含一個 live demo gallery。

PaddlePaddle/PaddleOCR

PaddleOCR 是一個開源 OCR 與文件 AI 工具包,可將圖像/PDF 轉換為結構化、對 LLM 準備就緒的 JSON 或 Markdown。它提供多語言場景文本模型 (PP‑OCRv6)、用於處理表格、公式與古籍文字的輕量化視覺語言解析器 (PaddleOCR‑VL‑1.6),以及結構感知型的 Pipeline (PP‑StructureV3)。模型可運行在 CPU, GPU, XPU, NPU 或透過 ONNX/TensorRT 運行,並與 Dify 和 RAGFlow 等 RAG/代理平台整合。

ruvnet/RuView

一個將無線電波轉化為空間智能的WiFi感測平台,可在無攝影機或可穿戴裝置的情況下偵測人員、追蹤生命體徵並估計姿態。

immich-app/immich

具備 AI 驅動人臉辨識與 CLIP 基礎搜尋的高效能自托管照片與影片管理解決方案。

roboflow/rf-detr

RF-DETR 是一種基於 DINOv2 骨幹的即時 Transformer 架構,用於物體檢測、實例分割和關鍵點檢測。

baidu/Unlimited-OCR

用於複雜文件、PDF 與多頁影像的一次完成長距離解析的多模態 OCR 模型。

Faceplugin-ltd/Open-Source-Face-Recognition-SDK

一個針對 Windows 和 Linux 的開源人臉辨識 SDK,使用深度學習技術提供本地化的臉部檢測、關鍵點檢測與相似度比較。

MaaAssistantArknights/MaaAssistantArknights

一款基於影像辨識與 OCR 的明日方舟自動化助手,用於自動化日常任務、資源農場與基地管理。

ultralytics/ultralytics

一個高效能的電腦視覺框架,實現 YOLO 模型,用於即時物件檢測、分割、分類和姿態估計。

julyx10/lap

一款開源、以本地為先的照片管理工具,利用本地AI實現搜尋與人臉辨識,提供雲端照片服務的私密替代方案。

amap-cvlab/ABot-Recon

ABot-Recon 是一種串流式 3D 重建系統,利用固定的 12 幀局部上下文,高效地從長影片串流中建構全域軌跡與點雲,無需持久的長距離記憶。

blakeblackshear/frigate

一個與 Home Assistant 緊密整合的本地 NVR,為 IP 攝影機提供即時 AI 物件偵測。

om-ai-lab/VLX-Seek

VLX‑Seek 是一個開源視覺-語言模型,可為邊緣設備代理執行細粒度感知。它生成區域提案,將每個區域編碼為特殊令牌,並讓語言模型透過選擇這些令牌來回答問題——從而為檢測、指代表達理解、OCR、計數和 VQA 生成緊湊、可解析的輸出。該倉儲包含推理程式碼、Python API 和 10 B 檢查點(權重託管於 Hugging Face 上)。

hacksider/Deep-Live-Cam

一款即時人臉交換與深度偽造工具,僅需一張來源影像即可替換影片或即時網路攝影機畫面中的人臉。

RapidAI/RapidOCR

一款將 PaddleOCR 模型轉換為 ONNX 格式的開源 OCR 工具,可在多個平台與語言中實現快速、低資源消耗的離線部署。

MaaXYZ/MaaFramework

一種基於影像辨識的自動化黑箱測試低程式碼框架,讓開發者能透過低程式碼管道協定建立軟體助手與自動化工具。

duy-phamduc68/TrafficLab-3D

一個端到端的交通分析套件,利用電腦視覺與自訂校準流程,從 CCTV 影像與衛星地圖生成 3D 數位雙生。

tesseract-ocr/tesseract

Tesseract 是一個開源的 OCR 引擎和命令列工具,可將文字圖片轉換為超過 100 種語言的機器可讀文字。

facebookresearch/vggt-omega

VGGT-Omega 是一個電腦視覺模型,能從影像中預測相機姿態與深度,以實現3D場景重構。

roboflow/supervision

一個電腦視覺工具包,提供用於數據載入、視覺化和數據集管理的模型無關構建模組,以加速視覺應用的開發。

Yuliang-Liu/MonkeyOCRv2

MonkeyOCRv2 是一個用於 Document AI 的開源視覺文字基礎模型。它搭載了基於 ViT 的視覺編碼器,以及多語言解析與理解頭(約 0.6-1.8 B 參數),在 17 種語言的 OCR、版面解析、VQA 和公式識別上達到了最先進的分數。模型可在 Hugging Face/ModelScope 上取得,可使用 Transformers 或 vLLM 執行(可選 CPU 支援與 DFlash 加速),並附帶了大型 MonkeyDoc v2 預訓練資料集。

MaaEnd/MaaEnd

一款專為遊戲 Endfield 設計的自動化助手,利用螢幕識別技術自動完成戰鬥、資源採集和日常管理任務。

opencv/opencv

OpenCV 是一個開源的電腦視覺程式庫,提供用於人工智慧和視覺感知開發的工具與演算法。

facebookresearch/sam3

SAM 3(帶概念的分割一切)是 Meta 的 8.48 億參數基礎模型,允許您使用自由形式文字(或視覺範例)提示影像或影片,並為所有匹配物件返回掩碼、邊界框與分數。它結合了 DETR 風格檢測器與 SAM 2 風格追蹤器,引入用於細粒度提示區分的存在性標記,並在超過 400 萬個自動標註概念上訓練。該倉儲提供安裝步驟、範例筆記本與用於評估的新 SA‑CO 基準(27 萬個概念)

mkturkcan/DART

一個免訓練框架,利用 TensorRT 優化與蒸餾主幹,將 SAM3 轉換為即時多類別開放詞彙偵測器。

Robbyant/lingbot-map

一種可從影片即時生成點雲與相機軌跡的前饋式3D基礎模型。

ace-trump-tech/DeltaForce-OBS-Locker

基於YOLOv14的即時物件偵測與目標鎖定系統,可過濾環境誤報,精準識別Delta Force遊戲中的角色

harry7557558/spirula-studio

一個無需 Python 或 PyTorch 的自包含 3D 高斯點雲渲染管道,可將照片和影片轉換為 3D 點雲和網格。

BigBodyCobain/Shadowbroker

一個去中心化的地理空間情蒐平台,將 60 多個即時 OSINT 資訊源聚合至單一地圖介面,用於全球威脅監控。

ByteDance-Seed/Depth-Anything-3

一種使用統一深度-射線表示,從單張或多張影像中預測空間一致的 3D 幾何、深度圖與相機姿態的模型。

oncologylab/histopia

一種用於連續切片組織學與蛋白質體影像分析的計算研究工具,支援跨組織切片的三維重建與空間拓撲分析。

roflcoopter/viseron

專為家庭與辦公室監控設計的自托管、僅限本地運行的 NVR 與 AI 電腦視覺軟體,支援物件與人臉辨識。

bhimrazy/receipt-ocr

一個使用 Tesseract 和 LLM 從收據影像中提取原始文字或結構化 JSON 資料的 OCR 引擎。

colmap/colmap

一個通用的 Structure‑from‑Motion 與 Multi‑View Stereo 流水線,用於從圖像集合重建 3D 結構。

sparkjsdev/spark

一款進階的 3D 高斯潑濺渲染器,適用於 THREE.js,能在廣泛的裝置支援下,於網頁上實現高效能、擬真的 3D 場景。

ZhengPeng7/BiRefNet

BiRefNet 是一種高解析度二值影像分割模型,能針對不同解析度的影像提供最尖端的背景移除與物件分割效能。

deepinsight/insightface

一個開源的 2D 與 3D 人臉分析工具箱,提供先進的演算法,用於人臉檢測、辨識與對齊。

ocrmypdf/OCRmyPDF

一個命令列工具,為掃描 PDF 添加 OCR 文字層,使其可搜尋且可複製貼上,同時保持影像品質。

beixiaocai/rebucca

一個結合 YOLO 檢測與 LLM 驗證的多通道影片分析平台,可提供結構化警示,用於安全與監控。

roryclear/clearcam

一個 AI 驅動的 NVR 系統,可為任意 RTSP 安全攝影機添加物件偵測、追蹤與 AI 生成的通知摘要功能。

freemocap/freemocap

一種無需昂貴專有硬體即可提供研究級追蹤的免費開源動作捕捉平台。

cvat-ai/cvat

一個用於為電腦視覺構建高品質視覺數據集的開源數據標註平台,支持圖像、影片和 3D 標註。

ruoyuw22-byte/NeuroMorph-Assessment

一個整合 CAT12 處理的自動化結構式 MRI 形態計量系統,用於測量腦組織體積並生成定量報告。

roboflow/trackers

一個即插即用的 Python 庫,為任意檢測模型提供多種物件追蹤演算法的基準實作。

playcanvas/supersplat

一個基於瀏覽器的開源編輯器,用於檢查、編輯、優化和發佈 3D Gaussian Splats。

nerfstudio-project/gsplat

用於 3D 高斯光柵化的 CUDA 加速函式庫,提供比官方實作更快、更節省記憶體的輻射場渲染方式。

thiagotigaz/ocr-it

一款針對 Chrome 與 Firefox 的擴充功能,利用本機 OCR 從禁止文字選取的分頁式網頁文件與檢視器中提取文字。

yakhyo/uniface

UniFace 是一個 Python 函式庫,將 15 種人臉分析任務——偵測、關鍵點、3D 網格、解析、遮罩、注視、頭部姿勢、人口統計、情緒、品質、防偽、識別、匿名化以及基於 FAISS 的相似度比對——整合進一個單一、易於安裝的套件中(支援 CPU、Apple Silicon 或 CUDA)。它提供一致的 API、自動下載經驗證的模型權重,並包含豐富的文檔、Notebooks 以及社群 Discord。