TIGER-AI-Lab/Pixel-Reasoner
Pixel-Level Reasoning Model trained with RL [NeuIPS25]
Pixel Reasoner – 픽셀 공간에서 생각하는 시각-언어 모델
무엇인가요 – 시각-언어 모델(VLM)에 명시적인 시각 조작 작업(예: zoom-in, select-frame)를 추가하는 연구용 프레임워크입니다. 모델은 추론 도중 이미지나 동영상 프레임을 능동적으로 탐색할 수 있습니다. 저자들은 7B VLM을 두 단계로 훈련했습니다:
- 지시어 튜닝 – 새로운 픽셀 공간 작업을 가르치기 위해 합성된 다단계 트레이스를 사용.
- 호기심 기반 강화학습 – 텍스트 추론과 유용한 시각 작업의 균형을 보상으로 모델에 제공.
결과적으로 모델은 실시간으로 시각적 증거를 질의할 수 있으며, 여러 시각 추론 벤치마크에서 최고 성능을 달성했습니다 (V* bench 84 %, TallyQA‑Complex 74 %, InfographicsVQA 84 %).
주요 기능
- 픽셀 공간 작업 – 생성 중에 호출할 수 있는 내장 명령어(
zoom-in,select-frame) - 이중 단계 훈련 – 지시어 튜닝(Open‑R1 기반) → 호기심 기반 RL(VL‑Rethinker 기반)
- 다단계 트레이젝터리 – SFT 및 RL 파이프라인은 시각-텍스트 상호작용 시퀀스를 수용
- 이미지/동영상 혼합 데이터 – RL 단계에서 정적 이미지뿐 아니라 동영상 프레임도 훈련 가능
- vLLM 기반 추론 – 평가 및 하류 응용을 위한 빠른 배치 생성
시작하기 (빠른 시작)
- 리포지토리 클론 후
instruction_tuning또는curiosity_driven_rl폴더로 이동. - 의존성 설치 – 제공된
install.md(또는installation.md)를 따라 Python 환경,vLLM,openrlhf설정. - 지시어 튜닝
cd instruction_tuning # sft.sh를 수정하여 모델 체크포인트와 SFT 데이터셋 경로 지정 bash sft.sh - 호기심 기반 RL – RL 데이터셋 준비, 웜스타트 체크포인트(
PixelReasoner‑WarmStart) 다운로드 후 멀티노드 또는 싱글노드 스크립트 실행:
(모든 하이퍼파라미터는 환경 변수로 노출됨. README에는cd curiosity_driven_rl export policy=/path/to/PixelReasoner‑WarmStart/checkpoint-246 bash scripts/train_vlm_multi.sh # 또는 train_vlm_single.shMAX_PIXELS,lr,bsz등 주요 항목 목록 포함) - 평가 – 이미지 기반(VStar) 및 동영상 기반(MVBench) 벤치마크용으로 제공된 HF 컬렉션 사용. VStar 예시:
필요에 따라export benchmark=vstar export policy=/path/to/trained/model bash scripts/eval_vlm_new.sheval_bsz,MAX_PIXELS, GPU 수 조정.
모델 및 데이터 (공개 중)
| 항목 | Hugging Face 링크 | 포함 내용 |
|---|---|---|
| PixelReasoner‑RL‑v1 | TIGER-Lab/PixelReasoner-RL-v1 |
추론/평가용으로 훈련된 7B 체크포인트 |
| PixelReasoner‑WarmStart | TIGER-Lab/PixelReasoner-WarmStart |
RL 정책 초기화용 사전 RL 체크포인트 |
| SFT 데이터 | TIGER-Lab/PixelReasoner-SFT-Data |
다단계 지시어 튜닝 트레이스 |
| RL 데이터 | TIGER-Lab/PixelReasoner-RL-Data |
호기심 기반 RL용 쿼리 및 보상 신호 |
| 평가 컬렉션 | README에 링크된 HF 컬렉션 | VStar, MVBench, 기타 시각 추론 벤치마크용 Parquet 파일 |
데모 및 웹사이트
- 온라인 데모 – 모델과 상호작용 가능한 Hugging Face Space (
https://huggingface.co/spaces/TIGER-Lab/Pixel-Reasoner) - 프로젝트 웹사이트 – 논문 PDF, 모델 카드, 시각 예시 포함 (
https://tiger-ai-lab.github.io/Pixel-Reasoner/)
일반적인 실수 (README에 기재됨)
- 컨텍스트 길이 오버플로우 – 이미지 토큰 + 텍스트 토큰이 모델의 10 240 토큰 제한을 넘지 않도록
MAX_PIXELS를 충분히 낮게 유지. - Transformer/vLLM 버전 불일치 – dtype 오류 발생 시, 리포지토리가 고정한 정확한 transformer 커밋을 재설치.
- 로그 확률 배치 크기 – 올바른 PPO 로그 확률 계산을 위해
logp_bsz는1(또는--micro_rollout_batch_size=1)이어야 함. - 분산 환경 변수 – Ray 사용 시
MAX_PIXELS/MIN_PIXELS를RUNTIME_ENV_JSON를 통해 전파.
연락처 및 인용
- 주요 연락처: Haozhe Wang (jasper.whz@outlook.com) – RL 버그 지원
- SFT 연락처: Muze (dlwlrma314516@gmail.com) – SFT 및 대체 RL 코드
- 인용:
@article{pixelreasoner, title={Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning}, author={Su, Alex and Wang, Haozhe and Ren, Weiming and Lin, Fangzhen and Chen, Wenhu}, journal={arXiv preprint arXiv:2505.15966}, year={2025} }
결론
Pixel Reasoner는 VLM에 픽셀 공간 작업을 도입하고, 결과 재현 또는 자체 시각 추론 에이전트 개발에 필요한 코드, 데이터, 사전 훈련 체크포인트를 제공하는 종합적인 연구 프로젝트입니다. 이는 명확히 최전선 AI/ML 분야에 속합니다.
관련
- Dispatch
- Dispatch
- 프로젝트
- Dispatch