TIGER-AI-Lab/Pixel-Reasoner

Pixel-Level Reasoning Model trained with RL [NeuIPS25]

Pixel Reasoner – 픽셀 공간에서 생각하는 시각-언어 모델

무엇인가요 – 시각-언어 모델(VLM)에 명시적인 시각 조작 작업(예: zoom-in, select-frame)를 추가하는 연구용 프레임워크입니다. 모델은 추론 도중 이미지나 동영상 프레임을 능동적으로 탐색할 수 있습니다. 저자들은 7B VLM을 두 단계로 훈련했습니다:

  1. 지시어 튜닝 – 새로운 픽셀 공간 작업을 가르치기 위해 합성된 다단계 트레이스를 사용.
  2. 호기심 기반 강화학습 – 텍스트 추론과 유용한 시각 작업의 균형을 보상으로 모델에 제공.

결과적으로 모델은 실시간으로 시각적 증거를 질의할 수 있으며, 여러 시각 추론 벤치마크에서 최고 성능을 달성했습니다 (V* bench 84 %, TallyQA‑Complex 74 %, InfographicsVQA 84 %).


주요 기능

  • 픽셀 공간 작업 – 생성 중에 호출할 수 있는 내장 명령어(zoom-in, select-frame)
  • 이중 단계 훈련 – 지시어 튜닝(Open‑R1 기반) → 호기심 기반 RL(VL‑Rethinker 기반)
  • 다단계 트레이젝터리 – SFT 및 RL 파이프라인은 시각-텍스트 상호작용 시퀀스를 수용
  • 이미지/동영상 혼합 데이터 – RL 단계에서 정적 이미지뿐 아니라 동영상 프레임도 훈련 가능
  • vLLM 기반 추론 – 평가 및 하류 응용을 위한 빠른 배치 생성

시작하기 (빠른 시작)

  1. 리포지토리 클론instruction_tuning 또는 curiosity_driven_rl 폴더로 이동.
  2. 의존성 설치 – 제공된 install.md (또는 installation.md)를 따라 Python 환경, vLLM, openrlhf 설정.
  3. 지시어 튜닝
    cd instruction_tuning
    # sft.sh를 수정하여 모델 체크포인트와 SFT 데이터셋 경로 지정
    bash sft.sh
    
  4. 호기심 기반 RL – RL 데이터셋 준비, 웜스타트 체크포인트(PixelReasoner‑WarmStart) 다운로드 후 멀티노드 또는 싱글노드 스크립트 실행:
    cd curiosity_driven_rl
    export policy=/path/to/PixelReasoner‑WarmStart/checkpoint-246
    bash scripts/train_vlm_multi.sh   # 또는 train_vlm_single.sh
    
    (모든 하이퍼파라미터는 환경 변수로 노출됨. README에는 MAX_PIXELS, lr, bsz 등 주요 항목 목록 포함)
  5. 평가 – 이미지 기반(VStar) 및 동영상 기반(MVBench) 벤치마크용으로 제공된 HF 컬렉션 사용. VStar 예시:
    export benchmark=vstar
    export policy=/path/to/trained/model
    bash scripts/eval_vlm_new.sh
    
    필요에 따라 eval_bsz, MAX_PIXELS, GPU 수 조정.

모델 및 데이터 (공개 중)

항목 Hugging Face 링크 포함 내용
PixelReasoner‑RL‑v1 TIGER-Lab/PixelReasoner-RL-v1 추론/평가용으로 훈련된 7B 체크포인트
PixelReasoner‑WarmStart TIGER-Lab/PixelReasoner-WarmStart RL 정책 초기화용 사전 RL 체크포인트
SFT 데이터 TIGER-Lab/PixelReasoner-SFT-Data 다단계 지시어 튜닝 트레이스
RL 데이터 TIGER-Lab/PixelReasoner-RL-Data 호기심 기반 RL용 쿼리 및 보상 신호
평가 컬렉션 README에 링크된 HF 컬렉션 VStar, MVBench, 기타 시각 추론 벤치마크용 Parquet 파일

데모 및 웹사이트

  • 온라인 데모 – 모델과 상호작용 가능한 Hugging Face Space (https://huggingface.co/spaces/TIGER-Lab/Pixel-Reasoner)
  • 프로젝트 웹사이트 – 논문 PDF, 모델 카드, 시각 예시 포함 (https://tiger-ai-lab.github.io/Pixel-Reasoner/)

일반적인 실수 (README에 기재됨)

  • 컨텍스트 길이 오버플로우 – 이미지 토큰 + 텍스트 토큰이 모델의 10 240 토큰 제한을 넘지 않도록 MAX_PIXELS를 충분히 낮게 유지.
  • Transformer/vLLM 버전 불일치 – dtype 오류 발생 시, 리포지토리가 고정한 정확한 transformer 커밋을 재설치.
  • 로그 확률 배치 크기 – 올바른 PPO 로그 확률 계산을 위해 logp_bsz1 (또는 --micro_rollout_batch_size=1)이어야 함.
  • 분산 환경 변수 – Ray 사용 시 MAX_PIXELS/MIN_PIXELSRUNTIME_ENV_JSON를 통해 전파.

연락처 및 인용

  • 주요 연락처: Haozhe Wang (jasper.whz@outlook.com) – RL 버그 지원
  • SFT 연락처: Muze (dlwlrma314516@gmail.com) – SFT 및 대체 RL 코드
  • 인용:
    @article{pixelreasoner,
      title={Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning},
      author={Su, Alex and Wang, Haozhe and Ren, Weiming and Lin, Fangzhen and Chen, Wenhu},
      journal={arXiv preprint arXiv:2505.15966},
      year={2025}
    }
    

결론

Pixel Reasoner는 VLM에 픽셀 공간 작업을 도입하고, 결과 재현 또는 자체 시각 추론 에이전트 개발에 필요한 코드, 데이터, 사전 훈련 체크포인트를 제공하는 종합적인 연구 프로젝트입니다. 이는 명확히 최전선 AI/ML 분야에 속합니다.

관련

  • Dispatch
  • Dispatch
  • 프로젝트
  • Dispatch