liustack/modlens

ModLens 是 DeepSeek Harness(和其他本機 AI 助理)的外掛程式,為純文字 LLM 新增視覺能力。使用者將影像直接貼到聊天中;外掛程式將其轉送到可設定的視覺引擎(Gemini、OpenAI 相容、Anthropic、Antigravity CLI、Claude/Kimi CLI 或本機代理),並傳回模型可引用的結構化轉錄。安裝只需一條 `npx` 命令或透過 `skills.sh`,具有零設定預設值和自動金鑰輪換/容錯移轉。該專案採用 MIT 授權,專注於輕量級整合而非重型包裝器。

royshil/obs-backgroundremoval

一款 OBS Studio 插件,利用神經網絡在無需物理綠幕的情況下,即時去除人像背景並增強低照度影片。

lyuwenyu/RT-DETR

基於檢測 Transformer(DETR)架構的即時物件檢測框架,旨在速度與準確度方面超越 YOLO 模型。

MaaEnd/MaaEnd

一款使用螢幕識別技術自動化戰鬥、資源採集和日常管理任務的遊戲Endfield自動化助手。

microsoft/MoGe

MoGe 是一個用於從單張開放領域影像中恢復精確 3D 結構的模型,包含度量深度與點圖。

sparkjsdev/spark

一個用於 THREE.js 的高階 3D 高斯潑濺渲染器,可實現基於潑濺的 3D 場景的高效能、跨裝置渲染。

MaaXYZ/MaaFramework

一種基於影像辨識的自動化黑箱測試低程式碼框架,讓開發者能透過低程式碼管道協定建立軟體助手與自動化工具。

beixiaocai/rebucca

一個結合 YOLO 檢測與 LLM 驗證的多通道影片分析平台,可提供結構化警示,用於安全與監控。

davidakpele/wifi-densepose

一個注重隱私的人體姿勢估計系統,利用WiFi通道狀態資訊(CSI)和機器學習,在無需攝影機的情況下偵測姿勢。

nerfstudio-project/gsplat

用於 3D 高斯光柵化的 CUDA 加速函式庫,提供比官方實作更快、更節省記憶體的輻射場渲染方式。

aloshdenny/reverse-SynthID

一個透過譜系分析與多階段對抗性管線,偵測並移除 Google Gemini 生成圖像中不可見的 SynthID 水印的逆向工程專案。

wasserth/TotalSegmentator

一個用於 CT 和 MR 影像中主要解剖結構自動分割的工具,提供詳細的解剖遮罩和身體統計數據。

valkia/aramgg_client

一款為《英雄聯盟》ARAM模式設計的Windows桌面助手,提供英雄選擇建議,並透過OCR識別遊戲內哈克科技增益,推薦最佳出裝。

google-deepmind/alphafold3

用於準確預測生物分子相互作用 3D 結構的 AlphaFold 3 推理流水線實現。

isl-org/Open3D

Open3D 是一個現代的 3D 數據處理函式庫,為點雲和網格操作、視覺化以及 3D 機器學習提供優化的工具。

open-edge-platform/anomalib

一個用於基準測試和部署異常檢測算法的深度學習庫,重點專注於圖像和影片中的視覺異常檢測。

pynicolas/FairScan

一款使用本地機器學習實現自動文件偵測與透視校正,以建立私密 PDF 的開源 Android 文件掃描器。

freemocap/freemocap

一種無需昂貴專有硬體即可提供研究級追蹤的免費開源動作捕捉平台。

lightly-ai/lightly-train

一個用於預訓練、微調與蒸餾 DINOv3 和 LTDETRv2 等最尖端模型的電腦視覺框架,適用於物件檢測與分割等任務。

huggingface/pytorch-image-models

一個全面的 PyTorch 函式庫,提供大量的尖端電腦視覺骨幹網路(backbones)和預訓練權重,方便整合至 AI 專案中。

WebODM/WebODM

一款商用級軟體,用於將無人機影像處理為地理參考地圖、點群、3D模型和高斯點陣。

ZhengPeng7/BiRefNet

BiRefNet 是一種高解析度二值影像分割模型,能針對不同解析度的影像提供最尖端的背景移除與物件分割效能。

vllm-project/llm-compressor

LLM Compressor 是一個 Python 庫,可將大型語言模型量化並剪枝為 `compressed-tensors` 格式,實現 vLLM 的記憶體高效部署。支援多種低精度格式(NVFP4、FP8、INT4 等)、多種 PTQ/GPTQ 算法、DDP 和磁碟卸載以處理超大模型,並提供多個熱門 LLM 的預量化檢查點。

NVIDIA/DLSS

NVIDIA DLSS SDK 提供遊戲用的高效能影像縮放與銳化工具,支援與 DX11、DX12 及 Vulkan 的整合。

opengeos/geoai

一個將 AI 框架與地理空間數據分析相結合的 Python 套件,提供衛星影像處理、模型訓練與推論工具。

realsenseai/librealsense

一個用於 RealSense 深度攝影機的跨平台 SDK,可實現深度與色彩串流,並為電腦視覺與機器人技術提供校準數據。

voxel51/fiftyone

透過提供視覺資料探索、標註與模型評估,協助建立高品質電腦視覺資料集與模型的開源工具。

NVlabs/Fast-FoundationStereo

透過知識蒸餾、神經架構搜尋與結構化剪枝,實現強大零樣本泛化的即時立體匹配架構家族。

opendatalab/OmniDocBench

一個用於評估真實場景中文檔解析的綜合性基準,包含版面檢測、OCR、表格和公式識別的豐富標註。

apple-aiml-research/ml-sharp

SHARP 是一個快速的單目視角合成工具,使用神經網路在不到一秒內從單張影像生成度量 3D 高斯表示。

Pointcept/Pointcept

用於點雲感知研究的強大且靈活的程式碼庫,整合了多種 3D 主幹網路與自我監督預訓練框架。

prs-eth/Marigold

一個利用 Stable Diffusion 等預訓練擴散模型,實現高解析度單目深度、表面法線與內在影像分析的條件生成模型家族。

roboflow/trackers

一個即插即用的 Python 庫,為任意檢測模型提供多種物件追蹤演算法的基準實作。

alicevision/Meshroom

一個基於節點的視覺程式設計框架,用於 3D 重建與電腦視覺,讓使用者能以 AI 與影像測量法建構複雜的資料處理管線。

roryclear/clearcam

一個為任意 RTSP 安全攝影機加入物件檢測、追蹤與 AI 生成事件摘要功能的 AI 驅動 NVR 系統。

Tencent/YOLO-Master

一種基於 YOLO 風格的即時物件檢測框架,利用混合專家(MoE)根據場景複雜度自適應分配運算,實現更高精確度與更低延遲。

vietanhdev/anylabeling

一款結合 YOLOv8 與 Segment Anything 的人工智慧驅動圖像標註工具,可為電腦視覺資料集提供自動標註功能。

facebookresearch/map-anything

一個開源研究框架,透過單個 Transformer 模型處理來自各種輸入組合的多種 3D 任務,實現通用的度量 3D 重建。

Breakthrough/PySceneDetect

一個自動識別場景變化以拆分影片或提取畫格的影片剪輯檢測與分析工具。

google/GNM

以 GNM Head 為開端的參數化統計 3D 人體模型系列,用於高保真地表示人體幾何形狀與外觀。

kornia/kornia

一個用於 PyTorch 的可微分電腦視覺函式庫,將古典影像處理與幾何視覺演算法整合至深度學習流程中。

Audiveris/audiveris

一款開源的光學樂譜辨識(OMR)應用程式,可將樂譜影像轉換為可播放與編輯的符號化數位格式。

datalab-to/surya

一個 650M 參數的 OCR 模型,用於文件智慧,可在 91 種語言中提供高準確度的文本辨識、版面分析與表格提取。

torinmb/mediapipe-touchdesigner

無需外部安裝即可在 TouchDesigner 中執行姿勢與手部追蹤等即時電腦視覺任務的 GPU 加速 MediaPipe 外掛程式。

Faceplugin-ltd/Open-Source-Face-Recognition-SDK

一個針對 Windows 和 Linux 的開源人臉辨識 SDK,使用深度學習技術提供本地化的臉部檢測、關鍵點檢測與相似度比較。

1bananachicken/MaaNTE

一款基於影像與音訊辨識的自動化工具,用於簡化遊戲 *異環* (The Ring) 中的重複性玩法與迷你遊戲。

pixpark/gpupixel

使用 OpenGL/ES 的高效能、跨平台 C++ 庫,用於影像與影片美顏濾鏡。

ucam-eo/tessera

TESSERA 是一個開源地理空間基礎模型,可將受雲層干擾的衛星時序數據轉換為用於全球地球表示和分析的緊湊型 128 維嵌入。