ysr666/dsh-vision-router

Eyes for text-only DeepSeek Harness agents: built-in free vision chain (no key) + pixel-level vision tools (Q&A, grounding, crop, pixel diff, colors, OCR, SVG trace, cutout, screenshots). One-command install, no Python, image turns work like ordinary tool-calling turns.

dsh‑vision‑router – DeepSeek Harness 的「眼睛」

是什么

  • 一个 DeepSeek Harness (DSH) 插件,让纯文本代理能够看到图像而不丢失任何像素信息。与将图像转换为纯文本描述不同,该插件将原始图像路由到视觉模型(或一系列免费视觉后端),并返回结构化结果,LLM 可以像调用普通工具一样调用这些结果。

为何重要

  • 大多数现有的 DSH 视觉插件仅提供图像的 有损 描述。dsh‑vision‑router 在视觉侧保留 原始像素,因此 LLM 可以提出后续问题、裁剪、比较或对同一张图片运行 OCR。
  • 开箱即用、免费、无需 Python 依赖——所有操作均在 Node ≥ 22 上使用 sharppotracetesseract 和系统 Chrome 完成。

核心功能

功能 你将获得
一键安装 npx @deepseek-ai/dsh plugin --profile web add dsh-vision-router(或通过 dshpm)自动为 DSH 添加所需的组合行和准入包装器。
免费匿名回退 无需 API 密钥的 OVHcloud 视觉端点(每 IP 约 2 次/分钟)。你还可以接入列出的任意免费提供商(如 Zhipu、DashScope、Intern AI 等)以获得更高配额。
无需 Python 所有图像处理(缩放、定位、裁剪、像素差分、调色板、OCR、SVG 跟踪、剪裁、HTML 截图)均使用原生 Node 库和 Chrome 完成。
多步图像工作流 图像处理变为普通工具调用:vision_ground → vision_crop → vision_describe → vision_pixel_diff …,允许代理迭代直至任务完成。
基于内容哈希缓存 视觉结果被缓存;后续文本回合可复用存储的描述,无需重新调用视觉模型。
稳定工具 Schema 插件启动时(或通过 progressiveTools:true 延迟加载)注册 11 个视觉工具。包括 vision_describevision_groundvision_cropvision_pixel_diffvision_ocrvision_trace 等。
自动提供者回退 若提供者返回 402/429/5xx 错误,链会静默尝试下一个提供者,最终回退到匿名 OVH 端点。
透明 UI 上传的图像在聊天 UI 中保持可见;路由到视觉工具仅在模型调用内部发生,因此对话日志保持干净。

工作原理(高层次)

  1. 用户上传或粘贴图像,同时使用标记为“+ Auto Vision”的模型组。
  2. DSH 检测到图像回合并 重写请求,使视觉模型首先被调用,返回 JSON 负载(或带注释的 PNG),而非纯文本回答。
  3. LLM(DeepSeek)接收工具结果,可决定调用更多视觉工具、缓存结果或继续对话。
  4. 视觉链成功后,最终答案返回用户;若所有提供者均失败,则显示友好错误信息。

安装与快速入门

# 一行命令(推荐)
npx @deepseek-ai/dsh plugin --profile web add dsh-vision-router

# 若运行本地 deepseek‑harness 仓库
cd deepseek-harness
pnpm dsh plugin --profile web add dsh-vision-router
  1. 重新加载/重启 DSH Web,使插件包被发现。
  2. 在聊天编辑器中打开 模型选择器 → 选择现在带有“+ Auto Vision”条目的模型组(例如 opencode-go + Auto Vision)。
  3. 粘贴或上传图像。内置 OVH 回退已配置,无需 API 密钥。
  4. 在代理提示中使用任意视觉工具,例如:
    vision_ground image="screenshot.png" target="send button"
    vision_crop   image="screenshot.png" region="1067,841,1108,881"
    vision_describe image="crop.png" question="What does this button say?" json=true
    

免费视觉后端(可通过插件配置的 httpProviders~/.dsh/.credentials.yaml 添加):

  • OVHcloud 匿名端点(每 IP 约 2 次/分钟)——默认回退。
  • OVHcloud 密钥端点(每项目 400 次/分钟)——更高配额。
  • Zhipu bigmodel.cn(无限令牌,中国直连)。
  • DashScope、Intern AI、Groq、Google AI Studio、NVIDIA NIM、OpenCode Zen、OpenRouter——各自有独立免费限额(详见 README 表)。

典型工作流

  • UI 验证vision_html_screenshot → vision_pixel_diff 以确保重建的 UI 与参考图像一致。
  • 表单自动化vision_ground 定位按钮,vision_crop 放大,vision_ocr 读取标签,然后通过代理发送点击。
  • 文档提取vision_long_screenshot_ocr 将长截图分割,对每个块运行 OCR,并拼接 Markdown 输出。

配置亮点

  • progressiveTools: false(默认)——所有 11 个工具立即可用。
  • cordis.patch.yml 中设置 progressiveTools: true,可仅在启动时暴露 vision_activate,其余工具按需加载。
  • 视觉提供者行可留空;OVH 匿名链始终为最终回退。
  • 缓存结果按附件内容哈希存储,支持跨回合“图像记忆”功能。

故障排除

  • 空白设置页面 – 已在 v1.4.4 修复;请确保使用该版本。
  • 模型组选择 – 必须选择“+ Auto Vision”条目;否则 DSH 会在插件生效前拒绝图像。
  • 速率限制错误 – 添加密钥 OVH 端点或其他免费提供者到链中。

总结:dsh‑vision‑router 将 DeepSeek Harness 中的图像上传转变为第一类工具调用,保留像素保真度,提供免费匿名视觉回退,且只需一个 npm 命令即可启动。它不是简单的演示或精选列表,而是一个真正的、可投入生产的 AI 工具插件。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • Dispatch