Anionex/agent-vision-toolkit
为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
해결하는 문제
딥시크 등 텍스트 기반 LLM 에이전트가 외부 시각 도구와 구조화된 방법론을 제공받아 시각 작업을 수행할 수 있도록 합니다. 이는 내장된 다중 모달성 없거나 이미지 도구가 시스템에서 차단된 모델의 한계를 우회하며, 네이티브 다중 모달 에이전트와 동일하게 이미지 Q&A, UI 복원, GUI 자동화를 효과적으로 수행할 수 있게 합니다.
작동 방식
일반적인 이미지 설명 생성이 아니라, 이 툴킷은 "초점 힌트" 접근 방식을 사용합니다. 대화에서 에이전트의 현재 의도를 추출하여 다중 모달 시각 모델에 힌트로 전달함으로써, 결과 설명이 태스크에 특화되고 현재 목표에 맞는 것이 되도록 합니다. 이 기능은 두 가지 주요 구성 요소를 통해 제공됩니다:
- 시각 도구 CLI: 쉘 접근이 가능한 모든 에이전트가 호출할 수 있는 명령줄 도구들 (
glance,ground,detect,trace,crop) - 무결함 통합: Codex, Claude Code, OpenCode와 같은 특정 에이전트를 위한 로컬 프록시 또는 네이티브 플러그인으로, 붙여넣기 이미지와 내장 이미지 도구가 투명하게 작동하도록 합니다.
대상 사용자
스크린샷 분석, 스케치에서 UI 재구성, 자율 GUI 운영과 같은 시각 기능을 추가하고 싶은 텍스트 기반 코딩 에이전트의 개발자 및 사용자. 네이티브 다중 모달 모델로 전환할 필요 없이 가능합니다.
주요 특징
- 태스크 중심 시각: 현재 의도에 따라 LLM이 관심을 갖는 구체적인 세부 정보를 포착하며, 일반적인 설명이 아닌 태스크에 특화된 설명 제공.
- 언어적 유연성: OpenAI Chat Completions, OpenAI Responses, Anthropic Messages 등 다양한 시각 API 프로토콜을 지원.
- 전문 시각 도구: 경계 상자 위치 지정(
ground), 요소 인벤토리(detect), 결정론적 SVG 경로 복원(trace)을 위한 도구 포함. - 사전 구성된 플레이북: 긴 스크린샷 OCR, 디자인에서 UI 복원, GUI 자동화와 같은 복잡한 작업을 위한 단계별 가이드 제공.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트