ysr666/dsh-vision-router
Eyes for text-only DeepSeek Harness agents: built-in free vision chain (no key) + pixel-level vision tools (Q&A, grounding, crop, pixel diff, colors, OCR, SVG trace, cutout, screenshots). One-command install, no Python, image turns work like ordinary tool-calling turns.
dsh‑vision‑router – DeepSeek Harness 的「眼睛」
是什么
- 一个 DeepSeek Harness (DSH) 插件,让纯文本代理能够看到图像而不丢失任何像素信息。与将图像转换为纯文本描述不同,该插件将原始图像路由到视觉模型(或一系列免费视觉后端),并返回结构化结果,LLM 可以像调用普通工具一样调用这些结果。
为何重要
- 大多数现有的 DSH 视觉插件仅提供图像的 有损 描述。dsh‑vision‑router 在视觉侧保留 原始像素,因此 LLM 可以提出后续问题、裁剪、比较或对同一张图片运行 OCR。
- 它 开箱即用、免费、无需 Python 依赖——所有操作均在 Node ≥ 22 上使用
sharp、potrace、tesseract和系统 Chrome 完成。
核心功能
| 功能 | 你将获得 |
|---|---|
| 一键安装 | npx @deepseek-ai/dsh plugin --profile web add dsh-vision-router(或通过 dshpm)自动为 DSH 添加所需的组合行和准入包装器。 |
| 免费匿名回退 | 无需 API 密钥的 OVHcloud 视觉端点(每 IP 约 2 次/分钟)。你还可以接入列出的任意免费提供商(如 Zhipu、DashScope、Intern AI 等)以获得更高配额。 |
| 无需 Python | 所有图像处理(缩放、定位、裁剪、像素差分、调色板、OCR、SVG 跟踪、剪裁、HTML 截图)均使用原生 Node 库和 Chrome 完成。 |
| 多步图像工作流 | 图像处理变为普通工具调用:vision_ground → vision_crop → vision_describe → vision_pixel_diff …,允许代理迭代直至任务完成。 |
| 基于内容哈希缓存 | 视觉结果被缓存;后续文本回合可复用存储的描述,无需重新调用视觉模型。 |
| 稳定工具 Schema | 插件启动时(或通过 progressiveTools:true 延迟加载)注册 11 个视觉工具。包括 vision_describe、vision_ground、vision_crop、vision_pixel_diff、vision_ocr、vision_trace 等。 |
| 自动提供者回退 | 若提供者返回 402/429/5xx 错误,链会静默尝试下一个提供者,最终回退到匿名 OVH 端点。 |
| 透明 UI | 上传的图像在聊天 UI 中保持可见;路由到视觉工具仅在模型调用内部发生,因此对话日志保持干净。 |
工作原理(高层次)
- 用户上传或粘贴图像,同时使用标记为“+ Auto Vision”的模型组。
- DSH 检测到图像回合并 重写请求,使视觉模型首先被调用,返回 JSON 负载(或带注释的 PNG),而非纯文本回答。
- LLM(DeepSeek)接收工具结果,可决定调用更多视觉工具、缓存结果或继续对话。
- 视觉链成功后,最终答案返回用户;若所有提供者均失败,则显示友好错误信息。
安装与快速入门
# 一行命令(推荐)
npx @deepseek-ai/dsh plugin --profile web add dsh-vision-router
# 若运行本地 deepseek‑harness 仓库
cd deepseek-harness
pnpm dsh plugin --profile web add dsh-vision-router
- 重新加载/重启 DSH Web,使插件包被发现。
- 在聊天编辑器中打开 模型选择器 → 选择现在带有“+ Auto Vision”条目的模型组(例如
opencode-go + Auto Vision)。 - 粘贴或上传图像。内置 OVH 回退已配置,无需 API 密钥。
- 在代理提示中使用任意视觉工具,例如:
vision_ground image="screenshot.png" target="send button" vision_crop image="screenshot.png" region="1067,841,1108,881" vision_describe image="crop.png" question="What does this button say?" json=true
免费视觉后端(可通过插件配置的 httpProviders 或 ~/.dsh/.credentials.yaml 添加):
- OVHcloud 匿名端点(每 IP 约 2 次/分钟)——默认回退。
- OVHcloud 密钥端点(每项目 400 次/分钟)——更高配额。
- Zhipu bigmodel.cn(无限令牌,中国直连)。
- DashScope、Intern AI、Groq、Google AI Studio、NVIDIA NIM、OpenCode Zen、OpenRouter——各自有独立免费限额(详见 README 表)。
典型工作流
- UI 验证 –
vision_html_screenshot → vision_pixel_diff以确保重建的 UI 与参考图像一致。 - 表单自动化 –
vision_ground定位按钮,vision_crop放大,vision_ocr读取标签,然后通过代理发送点击。 - 文档提取 –
vision_long_screenshot_ocr将长截图分割,对每个块运行 OCR,并拼接 Markdown 输出。
配置亮点
progressiveTools: false(默认)——所有 11 个工具立即可用。- 在
cordis.patch.yml中设置progressiveTools: true,可仅在启动时暴露vision_activate,其余工具按需加载。 - 视觉提供者行可留空;OVH 匿名链始终为最终回退。
- 缓存结果按附件内容哈希存储,支持跨回合“图像记忆”功能。
故障排除
- 空白设置页面 – 已在 v1.4.4 修复;请确保使用该版本。
- 模型组选择 – 必须选择“+ Auto Vision”条目;否则 DSH 会在插件生效前拒绝图像。
- 速率限制错误 – 添加密钥 OVH 端点或其他免费提供者到链中。
总结:dsh‑vision‑router 将 DeepSeek Harness 中的图像上传转变为第一类工具调用,保留像素保真度,提供免费匿名视觉回退,且只需一个 npm 命令即可启动。它不是简单的演示或精选列表,而是一个真正的、可投入生产的 AI 工具插件。
相关
- 项目
- 项目
- 项目
- 项目
- Dispatch