liustack/modlens

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网最强 DeepSeek Harness 外挂视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。

何を解決するか

ModLens は、テキストのみのAIモデル(DeepSeek や GLM など)が画像を「見る」および処理できるようにします。ユーザーが画像を手動でファイルに保存してパスを指定する必要がなく、チャットインターフェースに画像を直接貼り付けるだけで済みます。

動作方法

画像を貼り付けた際に、別途のビジョンエンジンに処理を送信するビジョンプラグインまたは「ブリッジ」として機能します。エンジンは画像を構造化された証拠(完全なテキスト変換、レイアウト領域、エンティティリストなど)に変換し、それをテキストのみのモデルにフィードバックします。Gemini、OpenAI互換エンドポイント、Anthropic、および既存のローカルエージェントCLI(Claude Code や Codex など)を含む幅広いビジョンプロバイダーをサポートしており、結果が得られるように自動フェイルオーバーが可能です。

対象ユーザー

DeepSeek Harness、Claude Code、Codex、Pi、OpenCode などのテキストのみのLLMハーネスの開発者およびユーザーで、モデルの切り替えや画像ファイルの手動管理なしにマルチモーダル機能を活用したい方。

特徴

  • ネイティブ統合:DeepSeek Harness (dsh) 用の最初のビジョンプラグインであり、modlens_read_image ツールを通じて画像を読み取ることができます。
  • ゼロ構成セットアップ:マシン上の他のAI CLI で既にログイン済みのアカウントを再利用可能。Gemini API や Antigravity CLI などの無料オプションも利用可能。
  • 構造化出力:想像力に基づく要約ではなく、証拠に基づく記述(テキスト変換とレイアウト)を提供。
  • 柔軟なエンジンプール:6つの組み込みプロバイダーと4つの再利用可能なローカルCLIをサポートし、自動フェイルオーバーチェーンを備えています。
  • 軽量:ローカルプロキシデーモンやハーネス設定の変更を必要とせず、単一のフォルダまたはプラグインとしてインストール可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト