TIGER-AI-Lab/Pixel-Reasoner
Pixel-Level Reasoning Model trained with RL [NeuIPS25]
Pixel Reasoner – 在像素空間中 思考 的視覺-語言模型
是什麼 – 一個研究級框架,為視覺-語言模型(VLM)添加明確的視覺操作(例如 zoom-in, select-frame),使模型能在推理過程中主動探索圖像或影片幀。作者透過兩個階段訓練了一個 7B VLM:
- 指令微調:在合成的多輪軌跡上進行,教授新的像素空間操作。
- 好奇心驅動的強化學習:獎勵模型在文字推理與有用的視覺操作之間取得平衡。
結果是能夠即時查詢視覺證據的 VLM,在多個視覺推理基準上取得最尖端的分數(V* bench 84 %, TallyQA‑Complex 74 %, InfographicsVQA 84 %)。
核心功能
- 像素空間操作 – 內建指令如
zoom-in,select-frame,模型可在生成過程中調用。 - 兩階段訓練 – 指令微調(基於 Open‑R1)→ 好奇心驅動的強化學習(基於 VL‑Rethinker)。
- 多輪軌跡 – SFT 和 RL 流水線均支援視覺-文字互動序列。
- 混合圖像/影片資料 – RL 階段可同時在影片幀與靜態圖像上訓練。
- 基於 vLLM 的推理 – 快速批量生成,適用於評估與下游應用。
快速入門
- 克隆倉庫 並進入目標子資料夾(
instruction_tuning或curiosity_driven_rl)。 - 安裝相依性 – 按照提供的
install.md(或installation.md)設定 Python 環境、vLLM和openrlhf。 - 指令微調
cd instruction_tuning # 編輯 sft.sh 以指向你的模型檢查點和 SFT 資料集 bash sft.sh - 好奇心驅動的強化學習 – 準備 RL 資料集,下載預熱檢查點(
PixelReasoner‑WarmStart),然後執行多節點或單節點腳本:
(所有超參數皆以環境變數暴露;README 列出最重要的參數,如cd curiosity_driven_rl export policy=/path/to/PixelReasoner‑WarmStart/checkpoint-246 bash scripts/train_vlm_multi.sh # 或 train_vlm_single.shMAX_PIXELS,lr,bsz等)。 - 評估 – 使用提供的 HF 集合進行圖像基準(VStar)和影片基準(MVBench)評估。VStar 範例:
根據需要調整export benchmark=vstar export policy=/path/to/trained/model bash scripts/eval_vlm_new.sheval_bsz,MAX_PIXELS和 GPU 數量。
模型與資料(公開托管)
| 項目 | Hugging Face 連結 | 包含內容 |
|---|---|---|
| PixelReasoner‑RL‑v1 | TIGER-Lab/PixelReasoner-RL-v1 |
可用於推理/評估的訓練好的 7B 檢查點 |
| PixelReasoner‑WarmStart | TIGER-Lab/PixelReasoner-WarmStart |
用於 RL 策略初始化的預 RL 檢查點 |
| SFT 資料 | TIGER-Lab/PixelReasoner-SFT-Data |
多輪指令微調軌跡 |
| RL 資料 | TIGER-Lab/PixelReasoner-RL-Data |
好奇心驅動 RL 的查詢與獎勵信號 |
| 評估集合 | README 中連結的 HF 集合 | VStar、MVBench 及其他視覺推理基準的 Parquet 檔案 |
演示與網站
- 線上示範 – 可與模型互動的 Hugging Face Space(
https://huggingface.co/spaces/TIGER-Lab/Pixel-Reasoner)。 - 專案網站 – 包含論文 PDF、模型卡片與視覺範例(
https://tiger-ai-lab.github.io/Pixel-Reasoner/)。
常見陷阱(如 README 所述)
- 上下文長度溢出 – 保持
MAX_PIXELS足夠低,使圖像 token + 文字 token 不超過模型的 10 240 token 限制。 - Transformer/vLLM 版本不匹配 – 若出現 dtype 錯誤,請重新安裝倉庫所指定的精確 transformer 提交版本。
- 日誌機率批次大小 – 為正確計算 PPO 日誌機率,
logp_bsz必須為1(或--micro_rollout_batch_size=1)。 - 分散式環境變數 – 使用 Ray 時,透過
RUNTIME_ENV_JSON傳遞MAX_PIXELS/MIN_PIXELS。
連絡與引用
- 主要聯絡人:Haozhe Wang (jasper.whz@outlook.com) – RL 問題支援。
- SFT 聯絡人:Muze (dlwlrma314516@gmail.com) – SFT 及替代 RL 程式碼。
- 引用:
@article{pixelreasoner, title={Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning}, author={Su, Alex and Wang, Haozhe and Ren, Weiming and Lin, Fangzhen and Chen, Wenhu}, journal={arXiv preprint arXiv:2505.15966}, year={2025} }
總結
Pixel Reasoner 是一個完整的科研專案,為 VLM 引入了 像素空間 操作,並提供重現結果或建構自訂視覺推理代理所需的程式碼、資料與預訓練檢查點。它明確位於最前線 AI/ML 領域。
相關
- Dispatch
- Dispatch
- 專案
- Dispatch