VILA-Lab/FigMirror

An Automated AI Agent Tool for Plotting Your Data in Any Paper's Figure Style.

何を解決するか

FigMirrorは、特定の学術論文の視覚スタイルに合わせてプロットコードを手動で編集する面倒なプロセスを排除します。ユーザーは参照図を提供し、自身のデータを入力することで、仕上げられたカメラレディPDFと、ターゲットスタイルを模倣した編集可能なmatplotlibスクリプトを自動生成できます。

動作方法

このシステムは、Drawer(描画者)とReviewer(レビュー者)からなるエージェントループを採用しています。

  1. Drawerエージェント:「Grounded Measurement」を用いて候補図をレンダリングします。これは、基礎モデルを活用して視覚的ターゲットのx/y座標を返し、それを実行可能なチェック(例:ピクセルカラーの確認)に変換します。
  2. Reviewerエージェント:候補図と参照画像を比較して視覚的審査を行います。構造化されたフィードバック(バウンディングボックス、修正チェックリスト、スタイルの保持リスト)を提供し、イテレーション間でのスタイルの逸脱を防ぎます。
  3. オーケストレーター:エージェント間のタスク割り当てを管理し、レビュアーのフィードバックを注釈付き画像とメモに変換して次の描画フェーズに供給します。

3D図の場合、カメラの角度、照明、スケールに対応するための幾何学的意識のあるプロンプトを使用します。エージェント間で合意が得られない場合や信頼度が低い場合のための「Aesthetic Lib」がフォールバックのスタイルルールを提供します。

対象ユーザー

特定のスタイルガイドラインに従うか、特定の論文シリーズの視覚的アイデンティティに一致させる必要がある、高品質で出版用の図を必要とする研究者やデータサイエンティスト。

特徴

  • エージェントループによる反復処理:継続的な視覚的最適化のための役割分担型Drawer/Reviewerループ。
  • Grounded Measurement:座標ベースの視覚的ターゲットとコードベースのピクセルチェックによる正確性。
  • 編集可能な出力:静的画像だけでなく、完全なmatplotlibスクリプトを生成。
  • マルチインターフェース対応:ローカルWeb UIとして利用可能。また、Claude CodeやCodexのスキルとしても利用可能。
  • 3D対応:3D構成と幾何学に特化したプロンプトを備えています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト