Anionex/dsh-vision-toolkit
[dsh]为纯文本模型设计更强大的视觉工具箱:一行安装使用、粘贴图片直接识别、多张图片问答、截图到前端UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.
해결하는 문제
이 툴킷은 텍스트 전용 AI 에이전트(특히 DeepSeek Harness에서 실행되는 것들)가 '보는' 것과 시각 데이터와 상호작용할 수 있도록 합니다. 텍스트 전용 모델이 스크린샷을 처리할 수 없고, 일반적인 설명에서는 중요한 시각적 세부 정보를 놓치며, 측정 가능한 UI 검증이나 자산 추출 기능이 부족하다는 문제를 해결합니다.
작동 방식
이것은 DeepSeek Harness(DSH)의 네이티브 플러그인으로, 시각 능력을 갖춘 모델(예: 내장된 Gemma 4 서비스)과 로컬 이미지 처리 도구 세트를 통합합니다. 사용자가 이미지를 붙여넣으면 플러그인은 에이전트를 '비전 툴킷' 버전으로 전환하여 시각적 증거, 좌표, 또는 로컬 처리 작업을 요청할 수 있게 합니다. 이후 에이전트는 이해를 위해 원격 비전 모델을 사용하거나, 자르기나 픽셀 차이 분석과 같은 결정론적 작업에 로컬 도구를 사용할 수 있습니다.
대상 사용자
DeepSeek Harness를 사용하고, 스크린샷 디버깅, 스케치에서 UI 재구성, 이미지에서 자산 추출, 또는 재구성된 페이지가 참조 이미지와 정확히 일치하는지 검증해야 하는 개발자 및 AI 에이전트 사용자.
주요 특징
- 무료 진입점: API 키 없이 사용 가능한 내장된 Gemma 4 비전 서비스 포함.
- 작업 중심의 비전: 에이전트는 검사의 구체적인 이유를 전송하여 일반적이거나 관련 없는 설명을 피합니다.
- 측정 가능한 UI 복원: 참조 이미지와의 UI 구현 정확도를 검증하기 위해 픽셀 수준의 차이 백분율과 히트맵 제공.
- 로컬 처리: SVG 트레이싱, 자르기, 색상 분석과 같은 작업은 로컬에서 실행되어 API 비용 절감.
- 포괄적인 도구 상자: 시각적 기반, OCR, 전경 추출, HTML 스크린샷 렌더링을 위한 10개의 전용 도구 포함.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트