Ch921-cell/Remember-R1
Official repository for the ACM MM 2026 Oral paper “Remember-R1: Mitigating Long-Context Visual Forgetting through Reinforcement Learning”
解決的問題
Remember-R1 解決了『長上下文視覺遺忘』問題,即多模態模型在長時間推理過程中難以維持與利用視覺資訊。
工作原理
本專案透過強化學習訓練模型,將標準的答案正確性獎勵擴展為三種特定的過程級獎勵:
- 視覺詞彙獎勵:鼓勵模型在推理過程中明確表達視覺證據。
- 視覺記憶獎勵:鼓勵模型在推理軌跡的後續步驟中持續依賴視覺資料。
- 視覺關鍵區域獎勵:鼓勵模型將注意力集中在與問題相關的影像區域。
適用對象
主要針對從事多模態大語言模型(MLLM)與需要長上下文記憶的視覺推理任務的 AI 研究人員與開發者。
亮點
- 實現用於緩解視覺遺忘的強化學習框架。
- 提供 3B 與 7B 參數規模的預訓練模型檢查點。
- 包含專門用於訓練與評估的資料集。
- 與 VLMEvalKit 整合,支援標準化效能評估。
相關
- 專案
- 專案
- 專案
- 專案