Ch921-cell/Remember-R1

Official repository for the ACM MM 2026 Oral paper “Remember-R1: Mitigating Long-Context Visual Forgetting through Reinforcement Learning”

何を解決するか

Remember-R1は、長期間の推論プロセス中に視覚情報を維持・活用することができないという『長期間視覚忘却』の問題に対処します。

動作方法

このプロジェクトは強化学習を用いて、標準的な正解報酬に加えて以下の3つのプロセスレベルの報酬を追加することでモデルを訓練します:

  • 視覚語彙報酬:モデルが推論中に視覚的証拠を明示的に表現するよう促します。
  • 視覚記憶報酬:モデルが推論の後続ステップでも視覚データに依存し続けるよう促します。
  • 視覚キーリージョン報酬:モデルが質問に関連する画像領域に注目するよう促します。

対象ユーザー

主に、長期間の記憶を必要とするマルチモーダル大規模言語モデル(MLLM)や視覚推論タスクに取り組むAI研究者および開発者向けです。

特徴

  • 視覚忘却を軽減するための強化学習フレームワークを実装。
  • 3Bおよび7Bパラメータサイズの事前学習済みモデルチェックポイントを提供。
  • 学習および評価用の専用データセットを含む。
  • VLMEvalKitと統合され、標準化されたパフォーマンス評価が可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト