ABBEL: 効率的な長時間相互作用のためにLLMに信念の更新を教える
ABBEL: 効率的な長時間相互作用のためにLLMに信念の更新を教える
BAIRは、フルインタラクション履歴を教師あり自然言語の「信念状態」に置き換えることで、長時間相互作用における効率的なメモリ維持を可能にするフレームワークABBELを導入しました。このアプローチは、特に高品質なトレーニングデータが乏しいドメインにおいて、再帰的自己要約で通常見られるパフォーマンス低下に対処します。
再帰的要約の問題
タスクのホライズンが数百または数千ステップに拡大すると(たとえば、共同ソフトウェア開発など)、モデルのコンテキスト内で全インタラクション履歴を維持することは非現実的になります。現在の業界標準は「コンテキスト圧縮」または再帰的要約であり、モデルは自身の履歴を要約してスペースを節約します。
ただし、BAIRは重要なパフォーマンスギャップを特定しました:自己要約を使用するモデルは、強化学習(RL)ファインチューニング後でもフルコンテキストモデルとのパフォーマンスギャップを埋めることがしばしばできません。これは、学習問題の複雑さの増加と、高品質なトレーニング環境を生成する効果的な人間シミュレータを作成する難しさによるものです。
ABBEL: 信念ボトルネックを通じた行動
ABBELは、要約を信念状態として定式化することで要約生成タスクを分離します。一般的な要約ではなく、モデルは新しい情報に基づいてこれらの信念状態を定期的に更新するよう促され、これは再帰的ベイズ推定からインスピレーションを得ています。
信念グレーディング
これらの要約の品質を向上させるために、ABBELは「信念グレーディング」という補助的なRLタスクを導入し、信念状態の情報量を監督します。これは以下の2つの主要な方法で達成されます:
- 一般的な再構成ベースのグレーディング: オートエンコーダーにインスパイアされた関数で、モデルはエンコーダーとデコーダーの両方として機能します。信念状態は、モデルがそれを使って歴史から最新の観測をどれだけよく再構成できるかに基づいて評価されます。
- ドメインナレッジグレーディング: 特定の環境では、グレーダーは既知のヒューリスティック(例えば、歴史上の統計を計算するなど)を使用して、信念状態が重要な情報を保持することを確保します。
パフォーマンスベンチマーク
BAIRは、ABBELを3つの異なる環境でテストし、その効率とメモリ使用量を測定しました:
コラボラティブコーディング (CollabBench)
CollabBench環境を使用して、再構成ベースの信念グレーディングを用いたABBEL(ABBEL-rec-BG)は、標準的な要約と比較して顕著な改善を示しました:
- パフォーマンス回復: サマリーベースのモデルとフルコンテキストモデル間のパフォーマンスギャップを約50%削減しました。
- トレーニング効率: トレーニングステップを50%削減しました(50ステップ vs. 100ステップ)。
- メモリ効率: フルコンテキストモデルと比較して、ピークコンテキストトークン長を低く維持しました。
コンビネーションロック
コンビネーションロック環境(Wordleライクなゲーム)では、ドメインナレッジ信念グレーディングを使用したABBELは、フルコンテキストモデルのパフォーマンスに近づいたりそれを上回ったりし、信念グレーディングのないモデルよりも高い学習効率を示しました。
マルチオブジェクト質問応答
マルチオブジェクトQAタスクにおいて、BAIRは信念状態を推論から切り離すことで「ピーク信念長ペナルティ(PBP)」が可能になることを発見しました。このペナルティは、パフォーマンスの低下が最小限であるにもかかわらずメモリ使用量を大幅に削減し、これは推論長にペナルティを課すときに通常見られるパフォーマンス低下とは対照的です。
代替メモリ戦略との比較
ABBELは、いくつかの点で他の長時間コンテキスト管理戦略と異なります:
- コンテキスト圧縮: 密な表現とは異なり、ABBELの信念状態は自然言語であり、人間が理解可能です。
- 手動設計のプロンプト/剪定: 静的なプロンプトとは異なり、ABBELはエージェントが何を覚えるべきかを意思決定戦略の一部として学習することを許可します。
- 外部メモリストア: ABBELはRAGスタイルの外部メモリと補完的であり、その後クエリされるコンテキストの作成を改善することができます。
AIメモリの今後の方向性
BAIRは、明示的な信念状態が、信念状態を改善する行動に報酬を与えて探索をガイドしたり、エージェント間のコミュニケーションを促進したり、ユーザーがエージェントのメモリを直接変更してより良い制御性を得たりするために使用できると示唆しています。
今後の研究では、作業メモリ(コンテキスト)、短期記憶、長期記憶(モデルの重みまたはアダプターメモリ)など、複数のメモリ形式を組み合わせて、テキスト alone で表現できない情報や、相互作用の生涯を通じて蓄積されたスキルを扱うことが likely です。