Anionex/dsh-vision-toolkit

[dsh]为纯文本模型设计更强大的视觉工具箱:一行安装使用、粘贴图片直接识别、多张图片问答、截图到前端UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.

解決する課題

このツールキットは、テキストのみのAIエージェント(特にDeepSeek Harnessで実行されるもの)が「見る」ことと視覚データと相互作用できるようにします。テキストのみのモデルがスクリーンショットを処理できないこと、一般的な記述では重要な視覚的詳細を逃すこと、測定可能なUI検証やアセット抽出ができないという問題を解決します。

動作方法

これはDeepSeek Harness(DSH)のネイティブプラグインとして機能し、視覚対応モデル(例:組み込みのGemma 4サービス)とローカル画像処理ツールのセットを統合します。ユーザーが画像を貼り付けると、プラグインはエージェントを「Vision Toolkit」バージョンに切り替え、視覚的証拠、座標、またはローカル処理タスクを要求できるようになります。その後、エージェントは理解のためにリモートの視覚モデルを使用するか、切り取りやピクセル差分計算などの決定論的タスクにローカルツールを使用するかを選択します。

対象ユーザー

DeepSeek Harnessを使用し、スクリーンショットのデバッグ、スケッチからのUI再作成、画像からのアセット抽出、または再構築されたページが参照画像と正確に一致しているかを検証する必要がある開発者やAIエージェントユーザー。

主な特徴

  • 無料のエントリーポイント:APIキー不要の組み込みGemma 4ビジョンサービスを含む。
  • タスク指向のビジョン:エージェントは検査の具体的な理由を送信し、一般的で関係のないキャプションを避ける。
  • 測定可能なUI復元:ピクセルレベルの差分パーセンテージとヒートマップを提供し、参照画像とのUI実装の整合性を検証。
  • ローカル処理:SVGトレース、切り取り、色分析などの操作はローカルで実行され、APIコストを節約。
  • 包括的なツールボックス:視覚的接地、OCR、フォアグラウンド抽出、HTMLスクリーンショットレンダリングのための10種類の専用ツールを含む。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト