liustack/modlens

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网最强 DeepSeek Harness 外挂视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。

解决的问题

ModLens 使仅支持文本的 AI 模型(如 DeepSeek 和 GLM)能够「看见」并处理图像。它消除了用户手动将图像保存为文件并提供路径的需要,用户只需将图像直接粘贴到聊天界面即可。

工作原理

它作为一个视觉插件或「桥梁」,拦截粘贴的图像并将其发送到独立的视觉引擎进行处理。该引擎将图像转换为结构化证据——包括完整文本转录、布局区域和实体列表——然后将这些信息反馈给仅支持文本的模型。它支持多种视觉提供者,包括 Gemini、OpenAI 兼容端点、Anthropic,以及现有的本地代理 CLI(如 Claude Code 或 Codex),并能自动在它们之间进行故障转移,以确保返回结果。

适用人群

使用仅支持文本的 LLM 工具(如 DeepSeek Harness、Claude Code、Codex、Pi 和 OpenCode)的开发者和用户,希望在不切换模型或手动管理图像文件的情况下获得多模态能力。

主要亮点

  • 原生集成:首个为 DeepSeek Harness (dsh) 设计的视觉插件,支持通过 modlens_read_image 工具读取图像。
  • 零配置设置:可复用机器上其他 AI CLI 的现有登录信息,或使用免费选项如 Gemini API 或 Antigravity CLI。
  • 结构化输出:提供基于证据的描述(文本转录和布局),而非想象性摘要。
  • 灵活的引擎池:支持六个内置提供者和四个可复用的本地 CLI,并具备自动故障转移链。
  • 轻量级:安装为单个文件夹或插件,无需本地代理守护进程或修改 harness 配置。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目