Ch921-cell/Remember-R1
Official repository for the ACM MM 2026 Oral paper “Remember-R1: Mitigating Long-Context Visual Forgetting through Reinforcement Learning”
해결하는 문제
Remember-R1은 장기적 추론 과정 동안 시각 정보를 유지하고 활용하는 데 어려움을 겪는 '장기적 시각적 망각' 문제를 해결합니다.
작동 방식
이 프로젝트는 표준 정답 보상에 세 가지 프로세스 수준 보상을 추가하여 강화학습을 통해 모델을 훈련합니다:
- 시각 어휘 보상: 모델이 추론 과정에서 시각적 증거를 명시적으로 표현하도록 유도합니다.
- 시각 기억 보상: 모델이 추론 경로의 후속 단계에서도 시각 데이터에 계속 의존하도록 유도합니다.
- 시각 핵심 영역 보상: 모델이 질문과 관련된 이미지 영역에 주목하도록 유도합니다.
대상 사용자
주로 장기적 컨텍스트 메모리가 필요한 다중 모달 대규모 언어 모델(MLLM) 및 시각 추론 작업에 종사하는 AI 연구자 및 개발자에게 적합합니다.
주요 특징
- 시각적 망각을 완화하기 위한 강화학습 프레임워크 구현.
- 3B 및 7B 파라미터 크기의 사전 학습된 모델 체크포인트 제공.
- 학습 및 평가를 위한 전용 데이터셋 포함.
- VLMEvalKit과 통합되어 표준화된 성능 평가 가능.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트