TIGER-AI-Lab/Pixel-Reasoner
Pixel-Level Reasoning Model trained with RL [NeuIPS25]
Pixel Reasoner – 在像素空间中 思考 的视觉-语言模型
是什么 – 一个研究级框架,为视觉-语言模型(VLM)添加显式的视觉操作(例如 zoom-in, select-frame),使模型能够在推理过程中主动探索图像或视频帧。作者通过两个阶段训练了一个7B VLM:
- 指令微调:在合成的多轮轨迹上进行,教授新的像素空间操作。
- 好奇心驱动的强化学习:奖励模型在文本推理与有用视觉操作之间取得平衡。
结果是一个能够实时查询视觉证据的VLM,在多个视觉推理基准上取得了最先进水平的分数(V* bench 84 %, TallyQA‑Complex 74 %, InfographicsVQA 84 %)。
核心能力
- 像素空间操作 – 内置命令如
zoom-in,select-frame,模型可在生成过程中调用。 - 两阶段训练 – 指令微调(基于 Open‑R1)→ 好奇心驱动的强化学习(基于 VL‑Rethinker)。
- 多轮轨迹 – SFT 和 RL 流水线均支持视觉-文本交互序列。
- 混合图像/视频数据 – RL 阶段可同时在视频帧和静态图像上训练。
- 基于 vLLM 的推理 – 快速批量生成,适用于评估和下游应用。
快速入门
- 克隆仓库 并进入目标子文件夹(
instruction_tuning或curiosity_driven_rl)。 - 安装依赖 – 按照提供的
install.md(或installation.md)设置 Python 环境、vLLM和openrlhf。 - 指令微调
cd instruction_tuning # 编辑 sft.sh 以指向你的模型检查点和 SFT 数据集 bash sft.sh - 好奇心驱动的强化学习 – 准备 RL 数据集,下载预热检查点(
PixelReasoner‑WarmStart),然后运行多节点或单节点脚本:
(所有超参数均作为环境变量暴露;README 列出了最重要的参数,如cd curiosity_driven_rl export policy=/path/to/PixelReasoner‑WarmStart/checkpoint-246 bash scripts/train_vlm_multi.sh # 或 train_vlm_single.shMAX_PIXELS,lr,bsz等)。 - 评估 – 使用提供的 HF 集合进行图像基准(VStar)和视频基准(MVBench)评估。VStar 示例:
根据需要调整export benchmark=vstar export policy=/path/to/trained/model bash scripts/eval_vlm_new.sheval_bsz,MAX_PIXELS和 GPU 数量。
模型与数据(公开托管)
| 项目 | Hugging Face 链接 | 包含内容 |
|---|---|---|
| PixelReasoner‑RL‑v1 | TIGER-Lab/PixelReasoner-RL-v1 |
可用于推理/评估的训练好的 7B 检查点 |
| PixelReasoner‑WarmStart | TIGER-Lab/PixelReasoner-WarmStart |
用于 RL 策略初始化的预 RL 检查点 |
| SFT 数据 | TIGER-Lab/PixelReasoner-SFT-Data |
多轮指令微调轨迹 |
| RL 数据 | TIGER-Lab/PixelReasoner-RL-Data |
好奇心驱动 RL 的查询与奖励信号 |
| 评估集合 | README 中链接的 HF 集合 | VStar、MVBench 及其他视觉推理基准的 Parquet 文件 |
演示与网站
- 在线演示 – 可与模型交互的 Hugging Face Space(
https://huggingface.co/spaces/TIGER-Lab/Pixel-Reasoner)。 - 项目网站 – 包含论文 PDF、模型卡片和视觉示例(
https://tiger-ai-lab.github.io/Pixel-Reasoner/)。
常见陷阱(如 README 所述)
- 上下文长度溢出 – 保持
MAX_PIXELS足够低,使图像 token + 文本 token 不超过模型的 10 240 token 限制。 - Transformer/vLLM 版本不匹配 – 若出现 dtype 错误,请重新安装仓库所指定的精确 transformer 提交版本。
- 日志概率批大小 – 为正确计算 PPO 日志概率,
logp_bsz必须为1(或--micro_rollout_batch_size=1)。 - 分布式环境变量 – 使用 Ray 时,通过
RUNTIME_ENV_JSON传递MAX_PIXELS/MIN_PIXELS。
联系与引用
- 主要联系人:Haozhe Wang (jasper.whz@outlook.com) – RL 问题支持。
- SFT 联系人:Muze (dlwlrma314516@gmail.com) – SFT 及替代 RL 代码。
- 引用:
@article{pixelreasoner, title={Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning}, author={Su, Alex and Wang, Haozhe and Ren, Weiming and Lin, Fangzhen and Chen, Wenhu}, journal={arXiv preprint arXiv:2505.15966}, year={2025} }
总结
Pixel Reasoner 是一个完整的科研项目,为 VLM 引入了 像素空间 操作,并提供了复现结果或构建自定义视觉推理代理所需的代码、数据和预训练检查点。它明确处于前沿 AI/ML 领域。
相关
- Dispatch
- Dispatch
- 项目
- Dispatch