ysr666/dsh-vision-router
Eyes for text-only DeepSeek Harness agents: built-in free vision chain (no key) + pixel-level vision tools (Q&A, grounding, crop, pixel diff, colors, OCR, SVG trace, cutout, screenshots). One-command install, no Python, image turns work like ordinary tool-calling turns.
dsh‑vision‑router – DeepSeek Harness 的「眼睛」
是什麼
- 一個 DeepSeek Harness (DSH) 插件,讓純文字代理能看見影像而不損失任何像素資訊。與將影像轉換為純文字描述不同,此插件將原始影像路由至視覺模型(或一系列免費視覺後端),並回傳結構化結果,讓 LLM 可像呼叫一般工具一樣呼叫這些結果。
為何重要
- 多數現有的 DSH 視覺插件僅提供影像的 有損 描述。dsh‑vision‑router 在視覺側保留 原始像素,因此 LLM 可提出後續問題、裁切、比較或對同一張影像執行 OCR。
- 它 開箱即用、免費、無需 Python 依賴——所有操作均在 Node ≥ 22 上使用
sharp、potrace、tesseract和系統 Chrome 完成。
核心功能
| 功能 | 你將獲得 |
|---|---|
| 一鍵安裝 | npx @deepseek-ai/dsh plugin --profile web add dsh-vision-router(或透過 dshpm)自動為 DSH 加入所需的組合行與准入包裝器。 |
| 免費匿名回退 | 無需 API 金鑰的 OVHcloud 視覺端點(每 IP 約 2 次/分鐘)。你也可接入列出的任意免費提供者(如 Zhipu、DashScope、Intern AI 等)以獲得更高配額。 |
| 無需 Python | 所有影像處理(縮放、定位、裁切、像素差分、調色板、OCR、SVG 跟蹤、剪裁、HTML 截圖)均使用原生 Node 庫和 Chrome 完成。 |
| 多步影像工作流 | 影像處理變為普通工具呼叫:vision_ground → vision_crop → vision_describe → vision_pixel_diff …,允許代理迭代直至任務完成。 |
| 基於內容雜湊快取 | 視覺結果被快取;後續文字回合可複用儲存的描述,無需重新呼叫視覺模型。 |
| 穩定工具 Schema | 插件啟動時(或透過 progressiveTools:true 延遲載入)註冊 11 個視覺工具。包括 vision_describe、vision_ground、vision_crop、vision_pixel_diff、vision_ocr、vision_trace 等。 |
| 自動提供者回退 | 若提供者回傳 402/429/5xx 錯誤,鏈會靜默嘗試下一個提供者,最終回退到匿名 OVH 端點。 |
| 透明 UI | 上傳的影像在聊天 UI 中保持可見;路由至視覺工具僅在模型呼叫內部發生,因此對話日誌保持乾淨。 |
工作原理(高階)
- 使用者上傳或貼上影像,同時使用標記為「+ Auto Vision」的模型組。
- DSH 檢測到影像回合並 重寫請求,使視覺模型首先被呼叫,回傳 JSON 負載(或帶註解的 PNG),而非純文字回應。
- LLM(DeepSeek)接收工具結果,可決定呼叫更多視覺工具、快取結果或繼續對話。
- 視覺鏈成功後,最終答案回傳使用者;若所有提供者均失敗,則顯示友善錯誤訊息。
安裝與快速入門
# 一行命令(推薦)
npx @deepseek-ai/dsh plugin --profile web add dsh-vision-router
# 若執行本地 deepseek‑harness 倉儲
cd deepseek-harness
pnpm dsh plugin --profile web add dsh-vision-router
- 重新載入/重啟 DSH Web,使插件包被發現。
- 在聊天編輯器中打開 模型選擇器 → 選擇現在帶有「+ Auto Vision」條目的模型組(例如
opencode-go + Auto Vision)。 - 貼上或上傳影像。內建 OVH 回退已設定,無需 API 金鑰。
- 在代理提示中使用任意視覺工具,例如:
vision_ground image="screenshot.png" target="send button" vision_crop image="screenshot.png" region="1067,841,1108,881" vision_describe image="crop.png" question="What does this button say?" json=true
免費視覺後端(可透過插件設定的 httpProviders 或 ~/.dsh/.credentials.yaml 加入):
- OVHcloud 匿名端點(每 IP 約 2 次/分鐘)——預設回退。
- OVHcloud 金鑰端點(每專案 400 次/分鐘)——更高配額。
- Zhipu bigmodel.cn(無限令牌,中國直連)。
- DashScope、Intern AI、Groq、Google AI Studio、NVIDIA NIM、OpenCode Zen、OpenRouter——各自有獨立免費限額(詳見 README 表)。
典型工作流程
- UI 驗證 –
vision_html_screenshot → vision_pixel_diff以確保重建的 UI 與參考影像一致。 - 表單自動化 –
vision_ground定位按鈕,vision_crop放大,vision_ocr讀取標籤,然後透過代理發送點擊。 - 文件提取 –
vision_long_screenshot_ocr將長截圖分割,對每個塊執行 OCR,並拼接 Markdown 輸出。
設定亮點
progressiveTools: false(預設)——所有 11 個工具立即可用。- 在
cordis.patch.yml中設定progressiveTools: true,可僅在啟動時暴露vision_activate,其餘工具按需載入。 - 視覺提供者行可留空;OVH 匿名鏈始終為最終回退。
- 快取結果按附件內容雜湊儲存,支援跨回合「影像記憶」功能。
故障排除
- 空白設定頁面 – 已在 v1.4.4 修復;請確保使用該版本。
- 模型組選擇 – 必須選擇「+ Auto Vision」條目;否則 DSH 會在插件生效前拒絕影像。
- 速率限制錯誤 – 加入金鑰 OVH 端點或其他免費提供者到鏈中。
總結:dsh‑vision‑router 將 DeepSeek Harness 中的影像上傳轉變為第一類工具呼叫,保留像素保真度,提供免費匿名視覺回退,且只需一個 npm 命令即可啟動。它不是簡單的示範或精選清單,而是一個真正的、可投入生產的 AI 工具插件。
相關
- 專案
- 專案
- 專案
- 專案
- Dispatch