Ch921-cell/Remember-R1

Official repository for the ACM MM 2026 Oral paper “Remember-R1: Mitigating Long-Context Visual Forgetting through Reinforcement Learning”

解決的問題

Remember-R1 解決了『長上下文視覺遺忘』問題,即多模態模型在長時間推理過程中難以維持與利用視覺資訊。

工作原理

本專案透過強化學習訓練模型,將標準的答案正確性獎勵擴展為三種特定的過程級獎勵:

  • 視覺詞彙獎勵:鼓勵模型在推理過程中明確表達視覺證據。
  • 視覺記憶獎勵:鼓勵模型在推理軌跡的後續步驟中持續依賴視覺資料。
  • 視覺關鍵區域獎勵:鼓勵模型將注意力集中在與問題相關的影像區域。

適用對象

主要針對從事多模態大語言模型(MLLM)與需要長上下文記憶的視覺推理任務的 AI 研究人員與開發者。

亮點

  • 實現用於緩解視覺遺忘的強化學習框架。
  • 提供 3B 與 7B 參數規模的預訓練模型檢查點。
  • 包含專門用於訓練與評估的資料集。
  • 與 VLMEvalKit 整合,支援標準化效能評估。

相關

  • 專案
  • 專案
  • 專案
  • 專案