Anionex/dsh-vision-toolkit
[dsh]为纯文本模型设计更强大的视觉工具箱:一行安装使用、粘贴图片直接识别、多张图片问答、截图到前端UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.
解決的問題
此工具包讓僅支援文字的 AI 代理(特別是運行於 DeepSeek Harness 中的代理)能夠「看見」並與視覺資料互動。它解決了純文字模型無法處理截圖、在一般描述中遺漏關鍵視覺細節,以及缺乏可測量的 UI 驗證或資產提取能力的問題。
工作原理
它作為 DeepSeek Harness(DSH)的原生外掛程式運作,整合了具備視覺能力的模型(例如內建的 Gemma 4 服務)與一系列本地影像處理工具。當使用者貼上一張影像時,外掛程式會將代理切換至「視覺工具包」模式,使其能夠請求視覺證據、座標或本地處理任務。隨後,代理可在使用遠端視覺模型進行理解,與使用本地工具執行決定性任務(如裁切或像素級差異分析)之間進行選擇。
適用對象
使用 DeepSeek Harness 並需要其代理執行視覺任務的開發者與 AI 代理使用者,例如調試截圖、根據草圖重建 UI、從影像中提取資產,或驗證重建頁面是否與參考影像完全一致。
主要亮點
- 免費入門:內建無需 API 金鑰的 Gemma 4 視覺服務。
- 任務導向的視覺能力:代理可傳送具體的檢查原因,避免產生通用且無關的描述。
- 可測量的 UI 復原:提供像素級差異百分比與熱力圖,用於驗證 UI 實作與參考影像的一致性。
- 本地處理:SVG 跟蹤、裁切、色彩分析等操作在本地執行,節省 API 成本。
- 全面的工具箱:包含 10 個專用工具,用於視覺定位、OCR、前景提取與 HTML 截圖渲染。
相關
- 專案
- 專案
- 專案
- 專案
- 專案