TIGER-AI-Lab/Pixel-Reasoner

Pixel-Level Reasoning Model trained with RL [NeuIPS25]

Pixel Reasoner – 在像素空間中 思考 的視覺-語言模型

是什麼 – 一個研究級框架,為視覺-語言模型(VLM)添加明確的視覺操作(例如 zoom-in, select-frame),使模型能在推理過程中主動探索圖像或影片幀。作者透過兩個階段訓練了一個 7B VLM:

  1. 指令微調:在合成的多輪軌跡上進行,教授新的像素空間操作。
  2. 好奇心驅動的強化學習:獎勵模型在文字推理與有用的視覺操作之間取得平衡。

結果是能夠即時查詢視覺證據的 VLM,在多個視覺推理基準上取得最尖端的分數(V* bench 84 %, TallyQA‑Complex 74 %, InfographicsVQA 84 %)。


核心功能

  • 像素空間操作 – 內建指令如 zoom-in, select-frame,模型可在生成過程中調用。
  • 兩階段訓練 – 指令微調(基於 Open‑R1)→ 好奇心驅動的強化學習(基於 VL‑Rethinker)。
  • 多輪軌跡 – SFT 和 RL 流水線均支援視覺-文字互動序列。
  • 混合圖像/影片資料 – RL 階段可同時在影片幀與靜態圖像上訓練。
  • 基於 vLLM 的推理 – 快速批量生成,適用於評估與下游應用。

快速入門

  1. 克隆倉庫 並進入目標子資料夾(instruction_tuningcuriosity_driven_rl)。
  2. 安裝相依性 – 按照提供的 install.md(或 installation.md)設定 Python 環境、vLLMopenrlhf
  3. 指令微調
    cd instruction_tuning
    # 編輯 sft.sh 以指向你的模型檢查點和 SFT 資料集
    bash sft.sh
    
  4. 好奇心驅動的強化學習 – 準備 RL 資料集,下載預熱檢查點(PixelReasoner‑WarmStart),然後執行多節點或單節點腳本:
    cd curiosity_driven_rl
    export policy=/path/to/PixelReasoner‑WarmStart/checkpoint-246
    bash scripts/train_vlm_multi.sh   # 或 train_vlm_single.sh
    
    (所有超參數皆以環境變數暴露;README 列出最重要的參數,如 MAX_PIXELS, lr, bsz 等)。
  5. 評估 – 使用提供的 HF 集合進行圖像基準(VStar)和影片基準(MVBench)評估。VStar 範例:
    export benchmark=vstar
    export policy=/path/to/trained/model
    bash scripts/eval_vlm_new.sh
    
    根據需要調整 eval_bsz, MAX_PIXELS 和 GPU 數量。

模型與資料(公開托管)

項目 Hugging Face 連結 包含內容
PixelReasoner‑RL‑v1 TIGER-Lab/PixelReasoner-RL-v1 可用於推理/評估的訓練好的 7B 檢查點
PixelReasoner‑WarmStart TIGER-Lab/PixelReasoner-WarmStart 用於 RL 策略初始化的預 RL 檢查點
SFT 資料 TIGER-Lab/PixelReasoner-SFT-Data 多輪指令微調軌跡
RL 資料 TIGER-Lab/PixelReasoner-RL-Data 好奇心驅動 RL 的查詢與獎勵信號
評估集合 README 中連結的 HF 集合 VStar、MVBench 及其他視覺推理基準的 Parquet 檔案

演示與網站

  • 線上示範 – 可與模型互動的 Hugging Face Space(https://huggingface.co/spaces/TIGER-Lab/Pixel-Reasoner)。
  • 專案網站 – 包含論文 PDF、模型卡片與視覺範例(https://tiger-ai-lab.github.io/Pixel-Reasoner/)。

常見陷阱(如 README 所述)

  • 上下文長度溢出 – 保持 MAX_PIXELS 足夠低,使圖像 token + 文字 token 不超過模型的 10 240 token 限制。
  • Transformer/vLLM 版本不匹配 – 若出現 dtype 錯誤,請重新安裝倉庫所指定的精確 transformer 提交版本。
  • 日誌機率批次大小 – 為正確計算 PPO 日誌機率,logp_bsz 必須為 1(或 --micro_rollout_batch_size=1)。
  • 分散式環境變數 – 使用 Ray 時,透過 RUNTIME_ENV_JSON 傳遞 MAX_PIXELS/MIN_PIXELS

連絡與引用

  • 主要聯絡人:Haozhe Wang (jasper.whz@outlook.com) – RL 問題支援。
  • SFT 聯絡人:Muze (dlwlrma314516@gmail.com) – SFT 及替代 RL 程式碼。
  • 引用
    @article{pixelreasoner,
      title={Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning},
      author={Su, Alex and Wang, Haozhe and Ren, Weiming and Lin, Fangzhen and Chen, Wenhu},
      journal={arXiv preprint arXiv:2505.15966},
      year={2025}
    }
    

總結

Pixel Reasoner 是一個完整的科研專案,為 VLM 引入了 像素空間 操作,並提供重現結果或建構自訂視覺推理代理所需的程式碼、資料與預訓練檢查點。它明確位於最前線 AI/ML 領域。

相關

  • Dispatch
  • Dispatch
  • 專案
  • Dispatch