Anionex/agent-vision-toolkit
为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
解決する課題
テキストのみのLLMエージェント(DeepSeekを搭載するものなど)が、外部の視覚ツールと構造化されたアプローチを提供されることで、視覚タスクを実行できるようになります。このアプローチは、ネイティブなマルチモーダル機能を持たないモデルや、画像ツールがシステムでブロックされているモデルの制限を回避し、ネイティブなマルチモーダルエージェントと同等に画像Q&A、UIの復元、GUI自動化を処理できるようにします。
動作方法
一般的な画像記述の生成ではなく、このツールキットは「焦点ヒント」アプローチを使用します。会話からエージェントの現在の意図を抽出し、それをマルチモーダル視覚モデルにヒントとして渡すことで、結果の記述がタスクに特化し、現在の目標に応じたものになります。この機能は以下の2つの主要コンポーネントを通じて提供されます:
- 視覚ツールのCLI:シェルアクセスを持つ任意のエージェントが呼び出せるコマンドラインツール群(
glance,ground,detect,trace,crop) - シームレス統合:特定のエージェント(Codex、Claude Code、OpenCodeなど)向けのローカルプロキシまたはネイティブプラグイン。これにより、貼り付けられた画像や組み込みの画像ツールが透明に動作します。
対象ユーザー
スクリーンショット分析、スケッチからのUI再構築、自律的なGUI操作などの視覚機能を追加したい、テキストのみのコーディングエージェントの開発者やユーザー。ネイティブなマルチモーダルモデルに切り替える必要はありません。
特徴
- タスクに特化した視覚:現在の意図に基づき、LLMが関心を持つ具体的な詳細を捉える。広範な記述ではなく、タスクに特化した記述を提供。
- 言語的柔軟性:OpenAI Chat Completions、OpenAI Responses、Anthropic Messagesなど、複数の視覚APIプロトコルをサポート。
- 専用の視覚ツール:バウンディングボックスの局所化(
ground)、要素のインベントリ(detect)、決定論的なSVGトラジェクトリの復元(trace)を実現するツールを含む。 - 事前構築されたプレイブック:長画面スクリーンショットのOCR、デザインからのUI復元、GUI自動化など、複雑なタスクのためのステップバイステップガイドを提供。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト