liustack/modlens

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网最强 DeepSeek Harness 外挂视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。

해결하는 문제

ModLens는 텍스트 전용 AI 모델(DeepSeek, GLM 등)이 이미지를 '보는' 것과 처리할 수 있도록 합니다. 사용자가 이미지를 수동으로 파일로 저장하고 경로를 제공할 필요 없이, 채팅 인터페이스에 이미지를 직접 붙여넣기만 하면 됩니다.

작동 방식

붙여넣은 이미지를 가로채서 별도의 비전 엔진에 전달하는 비전 플러그인 또는 '브리지'로 작동합니다. 엔진은 이미지를 구조화된 증거(완전한 텍스트 전사, 레이아웃 영역, 엔티티 목록 등)로 변환한 후, 텍스트 전용 모델로 다시 전달합니다. Gemini, OpenAI 호환 엔드포인트, Anthropic, 기존 로컬 에이전트 CLI(예: Claude Code, Codex) 등 다양한 비전 제공자를 지원하며, 결과를 확보하기 위해 자동으로 장애 대체를 수행합니다.

대상 사용자

DeepSeek Harness, Claude Code, Codex, Pi, OpenCode와 같은 텍스트 전용 LLM 해서를 사용하는 개발자 및 사용자로, 모델 전환이나 이미지 파일 수동 관리 없이 멀티모달 기능을 원하는 분들입니다.

주요 특징

  • 네이티브 통합: DeepSeek Harness (dsh)용 최초의 비전 플러그인으로, modlens_read_image 도구를 통해 이미지를 읽을 수 있습니다.
  • 제로 구성 설정: 기존 AI CLI에서 로그인한 계정을 재사용하거나, Gemini API 또는 Antigravity CLI와 같은 무료 옵션을 사용할 수 있습니다.
  • 구조화된 출력: 상상력 기반 요약이 아닌, 증거 기반 설명(전사 및 레이아웃)을 제공합니다.
  • 유연한 엔진 풀: 6개의 내장 제공자와 4개의 재사용 가능한 로컬 CLI를 지원하며, 자동 장애 대체 체인을 갖추고 있습니다.
  • 경량: 로컬 프록시 데몬이나 해서 설정 변경 없이 단일 폴더 또는 플러그인으로 설치 가능합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트