TIGER-AI-Lab/Pixel-Reasoner

Pixel-Level Reasoning Model trained with RL [NeuIPS25]

Pixel Reasoner – 在像素空间中 思考 的视觉-语言模型

是什么 – 一个研究级框架,为视觉-语言模型(VLM)添加显式的视觉操作(例如 zoom-in, select-frame),使模型能够在推理过程中主动探索图像或视频帧。作者通过两个阶段训练了一个7B VLM:

  1. 指令微调:在合成的多轮轨迹上进行,教授新的像素空间操作。
  2. 好奇心驱动的强化学习:奖励模型在文本推理与有用视觉操作之间取得平衡。

结果是一个能够实时查询视觉证据的VLM,在多个视觉推理基准上取得了最先进水平的分数(V* bench 84 %, TallyQA‑Complex 74 %, InfographicsVQA 84 %)。


核心能力

  • 像素空间操作 – 内置命令如 zoom-in, select-frame,模型可在生成过程中调用。
  • 两阶段训练 – 指令微调(基于 Open‑R1)→ 好奇心驱动的强化学习(基于 VL‑Rethinker)。
  • 多轮轨迹 – SFT 和 RL 流水线均支持视觉-文本交互序列。
  • 混合图像/视频数据 – RL 阶段可同时在视频帧和静态图像上训练。
  • 基于 vLLM 的推理 – 快速批量生成,适用于评估和下游应用。

快速入门

  1. 克隆仓库 并进入目标子文件夹(instruction_tuningcuriosity_driven_rl)。
  2. 安装依赖 – 按照提供的 install.md(或 installation.md)设置 Python 环境、vLLMopenrlhf
  3. 指令微调
    cd instruction_tuning
    # 编辑 sft.sh 以指向你的模型检查点和 SFT 数据集
    bash sft.sh
    
  4. 好奇心驱动的强化学习 – 准备 RL 数据集,下载预热检查点(PixelReasoner‑WarmStart),然后运行多节点或单节点脚本:
    cd curiosity_driven_rl
    export policy=/path/to/PixelReasoner‑WarmStart/checkpoint-246
    bash scripts/train_vlm_multi.sh   # 或 train_vlm_single.sh
    
    (所有超参数均作为环境变量暴露;README 列出了最重要的参数,如 MAX_PIXELS, lr, bsz 等)。
  5. 评估 – 使用提供的 HF 集合进行图像基准(VStar)和视频基准(MVBench)评估。VStar 示例:
    export benchmark=vstar
    export policy=/path/to/trained/model
    bash scripts/eval_vlm_new.sh
    
    根据需要调整 eval_bsz, MAX_PIXELS 和 GPU 数量。

模型与数据(公开托管)

项目 Hugging Face 链接 包含内容
PixelReasoner‑RL‑v1 TIGER-Lab/PixelReasoner-RL-v1 可用于推理/评估的训练好的 7B 检查点
PixelReasoner‑WarmStart TIGER-Lab/PixelReasoner-WarmStart 用于 RL 策略初始化的预 RL 检查点
SFT 数据 TIGER-Lab/PixelReasoner-SFT-Data 多轮指令微调轨迹
RL 数据 TIGER-Lab/PixelReasoner-RL-Data 好奇心驱动 RL 的查询与奖励信号
评估集合 README 中链接的 HF 集合 VStar、MVBench 及其他视觉推理基准的 Parquet 文件

演示与网站

  • 在线演示 – 可与模型交互的 Hugging Face Space(https://huggingface.co/spaces/TIGER-Lab/Pixel-Reasoner)。
  • 项目网站 – 包含论文 PDF、模型卡片和视觉示例(https://tiger-ai-lab.github.io/Pixel-Reasoner/)。

常见陷阱(如 README 所述)

  • 上下文长度溢出 – 保持 MAX_PIXELS 足够低,使图像 token + 文本 token 不超过模型的 10 240 token 限制。
  • Transformer/vLLM 版本不匹配 – 若出现 dtype 错误,请重新安装仓库所指定的精确 transformer 提交版本。
  • 日志概率批大小 – 为正确计算 PPO 日志概率,logp_bsz 必须为 1(或 --micro_rollout_batch_size=1)。
  • 分布式环境变量 – 使用 Ray 时,通过 RUNTIME_ENV_JSON 传递 MAX_PIXELS/MIN_PIXELS

联系与引用

  • 主要联系人:Haozhe Wang (jasper.whz@outlook.com) – RL 问题支持。
  • SFT 联系人:Muze (dlwlrma314516@gmail.com) – SFT 及替代 RL 代码。
  • 引用
    @article{pixelreasoner,
      title={Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning},
      author={Su, Alex and Wang, Haozhe and Ren, Weiming and Lin, Fangzhen and Chen, Wenhu},
      journal={arXiv preprint arXiv:2505.15966},
      year={2025}
    }
    

总结

Pixel Reasoner 是一个完整的科研项目,为 VLM 引入了 像素空间 操作,并提供了复现结果或构建自定义视觉推理代理所需的代码、数据和预训练检查点。它明确处于前沿 AI/ML 领域。

相关

  • Dispatch
  • Dispatch
  • 项目
  • Dispatch