liustack/modlens

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网最强 DeepSeek Harness 外挂视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。

解決的問題

ModLens 讓僅支援文字的 AI 模型(例如 DeepSeek 和 GLM)能夠「看見」並處理圖片。它消除了使用者手動將圖片儲存為檔案並提供路徑的需要,使用者只需將圖片直接貼到聊天介面即可。

工作原理

它作為一個視覺外掛程式或「橋樑」,攔截貼上的圖片並傳送至獨立的視覺引擎進行處理。該引擎將圖片轉換為結構化證據——包含完整文字轉錄、版面區域與實體清單——然後將這些資訊回傳給僅支援文字的模型。它支援多種視覺提供者,包括 Gemini、OpenAI 相容端點、Anthropic,以及現有的本地代理 CLI(如 Claude Code 或 Codex),並能自動在它們之間進行故障轉移,以確保回傳結果。

適用對象

使用僅支援文字的 LLM 工具(如 DeepSeek Harness、Claude Code、Codex、Pi 和 OpenCode)的開發者與使用者,希望在不切換模型或手動管理圖片檔案的情況下獲得多模態能力。

主要亮點

  • 原生整合:首個為 DeepSeek Harness (dsh) 設計的視覺外掛程式,支援透過 modlens_read_image 工具讀取圖片。
  • 零設定設定:可重複使用機器上其他 AI CLI 的現有登入資訊,或使用免費選項如 Gemini API 或 Antigravity CLI。
  • 結構化輸出:提供基於證據的描述(文字轉錄與版面),而非想像性摘要。
  • 彈性引擎池:支援六個內建提供者與四個可重複使用的本地 CLI,並具備自動故障轉移鏈。
  • 輕量級:安裝為單一資料夾或外掛程式,無需本地代理守護程序或修改 harness 設定。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案