Anionex/agent-vision-toolkit
为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
解决的问题
该工具包通过提供一组外部视觉工具和结构化方法论,使仅支持文本的 LLM 代理(如 DeepSeek 驱动的代理)能够执行视觉任务。这绕过了缺乏原生多模态能力或图像工具被系统屏蔽的模型的限制,使其能够像原生多模态代理一样高效完成图像问答、UI 恢复和 GUI 自动化。
如何工作
该工具包不生成通用的图像描述,而是采用「焦点提示」方法。它从对话中提取代理的当前意图,并将其作为提示传递给多模态视觉模型,确保生成的描述具有任务感知性且与当前目标高度相关。该功能通过两个主要组件实现:
- 视觉工具 CLI:一组命令行工具(
glance,ground,detect,trace,crop),任何具备 shell 访问权限的代理均可调用。 - 无缝集成:针对特定代理(如 Codex、Claude Code、OpenCode)的本地代理或原生插件,支持粘贴图像和内置图像工具的透明使用。
适用人群
希望为仅支持文本的编码代理添加视觉能力(如截图分析、从草图重建 UI、自主 GUI 操作)但又不想切换到原生多模态模型的开发者和用户。
核心亮点
- 任务感知视觉:根据当前意图捕捉 LLM 关注的具体细节,而非提供宽泛的描述。
- 语言灵活性:支持多种视觉 API 协议,包括 OpenAI Chat Completions、OpenAI Responses 和 Anthropic Messages。
- 专用视觉工具:包含用于边界框定位(
ground)、元素清单(detect)和确定性 SVG 轨迹恢复(trace)的工具。 - 现成操作手册:提供复杂任务(如长截图 OCR、从设计图恢复 UI、GUI 自动化)的分步指南。
相关
- 项目
- 项目
- 项目
- 项目
- 项目