Anionex/agent-vision-toolkit
为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
解決的問題
透過提供一組外部視覺工具與結構化方法論,使僅支援文字的 LLM 代理(例如由 DeepSeek 驅動的代理)能執行視覺任務。此方法繞過了缺乏原生多模態能力或圖像工具被系統封鎖的模型限制,讓其能像原生多模態代理一樣,有效執行圖像問答、UI 復原與 GUI 自動化。
如何運作
該工具包不產生通用的圖像描述,而是採用「焦點提示」方法。從對話中提取代理的當前意圖,並將其作為提示傳遞給多模態視覺模型,確保產生的描述具備任務感知性且與當前目標高度相關。此功能透過兩個主要組件實現:
- 視覺工具 CLI:一組命令列工具(
glance,ground,detect,trace,crop),任何具備 shell 存取權限的代理皆可呼叫。 - 無縫整合:針對特定代理(如 Codex、Claude Code、OpenCode)的本地代理或原生外掛程式,支援貼上圖像與內建圖像工具的透明使用。
適用對象
希望為僅支援文字的編碼代理添加視覺能力(如截圖分析、從草圖重建 UI、自主 GUI 操作)但又不想切換至原生多模態模型的開發者與使用者。
核心亮點
- 任務感知視覺:根據當前意圖捕捉 LLM 所關注的具體細節,而非提供廣泛的描述。
- 語言彈性:支援多種視覺 API 協定,包括 OpenAI Chat Completions、OpenAI Responses 與 Anthropic Messages。
- 專用視覺工具:包含用於邊界框定位(
ground)、元素清單(detect)與決定性 SVG 軌跡還原(trace)的工具。 - 現成操作手冊:提供複雜任務(如長截圖 OCR、從設計圖恢復 UI、GUI 自動化)的逐步指南。
相關
- 專案
- 專案
- 專案
- 專案
- 專案