Anionex/dsh-vision-toolkit

[dsh]为纯文本模型设计更强大的视觉工具箱:一行安装使用、粘贴图片直接识别、多张图片问答、截图到前端UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.

解决的问题

该工具包使仅支持文本的 AI 代理(特别是运行在 DeepSeek Harness 中的代理)能够「看见」并交互视觉数据。它解决了纯文本模型无法处理截图、在通用描述中遗漏关键视觉细节,以及缺乏可测量的 UI 验证或资产提取能力的问题。

工作原理

它作为 DeepSeek Harness(DSH)的原生插件运行,集成了具备视觉能力的模型(如内置的 Gemma 4 服务)与一系列本地图像处理工具。当用户粘贴一张图像时,插件会将代理切换到「视觉工具包」模式,使其能够请求视觉证据、坐标或本地处理任务。随后,代理可在使用远程视觉模型进行理解与使用本地工具执行确定性任务(如裁剪或像素级差异分析)之间进行选择。

适用人群

使用 DeepSeek Harness 并需要其代理执行视觉任务的开发者和 AI 代理用户,例如调试截图、根据草图重建 UI、从图像中提取资产,或验证重建页面是否与参考图像完全一致。

主要亮点

  • 免费入门:包含无需 API 密钥的内置 Gemma 4 视觉服务。
  • 任务导向的视觉能力:代理可发送具体的检查原因,避免生成通用且无关的描述。
  • 可测量的 UI 恢复:提供像素级差异百分比和热力图,用于验证 UI 实现与参考图像的一致性。
  • 本地处理:SVG 跟踪、裁剪、颜色分析等操作在本地运行,节省 API 成本。
  • 全面的工具箱:包含 10 个专用工具,用于视觉定位、OCR、前景提取和 HTML 截图渲染。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目