ABBEL: 教導LLM更新信念以實現高效長期互動
ABBEL: 教導LLM更新信念以實現高效長期互動
BAIR 已經推出 ABBEL,一個旨在透過將完整互動歷史替換為監督式自然語言「信念狀態」來使大型語言模型(LLM)在長期互動中保持高效記憶的框架。此方法解決了在遞歸自我摘要中常見的效能下降問題,特別是在高品質訓練資料稀缺的領域。
遞歸摘要的問題
當任務範圍擴展到數百或數千步時—例如在協作軟體開發中—在模型的上下文中維護完整的互動歷史變得不切實際。目前業界標準是「內容壓縮」或遞歸摘要,即模型摘要自己的歷史以節省空間。
然而,BAIR 指出存在一個關鍵的效能差距:使用自摘要的模型即使在強化學習(RL)微調後,也常常無法縮小與完整上下文模型的差距。這歸因於學習問題複雜度的增加以及建立有效的人類模擬器以產生高品質訓練環境的困難。
ABBEL: 透過信念瓶頸行動
ABBEL 透過將摘要制定為信念狀態來隔離摘要生成任務。與一般摘要不同,模型會定期根據新資訊被提示更新這些信念狀態,這種做法靈感來源於遞歸貝葉斯估計。
信念評分
為了提升這些摘要的品質,ABBEL 引入了「信念評分」,這是一個輔助的強化學習(RL)任務,用於監督信念狀態的資訊內容。這透過兩種主要方法實現:
- 一般重建式評分: 受自編碼器啟發的函數,模型同時擔任編碼器和解碼器。根據模型使用該信念狀態重建歷史中最新觀測值的好壞來對信念狀態進行評分。
- 領域知識評分: 在特定環境中,評分器會使用已知的啟發式方法(例如,計算歷史的統計資訊)來確保信念狀態保留關鍵資訊。
效能基準
BAIR 在三個不同的環境中測試了 ABBEL,以衡量其效率和記憶體使用:
協作編碼 (CollabBench)
使用 CollabBench 環境,採用重建式信念評分的 ABBEL (ABBEL-rec-BG) 在標準摘要上展示了顯著的改進:
- 效能恢復: 它將基於摘要的模型與完整上下文模型之間的效能差距減少了約 50%。
- 訓練效率: 所需的訓練步驟減少了 50%(50 步 vs. 100 步)。
- 記憶體效率: 其峰值上下文標記長度低於完整上下文模型。
組合鎖
在組合鎖環境(類似 Wordle 的遊戲)中,使用領域知識信念評分的 ABBEL 的表現接近或超過了完整上下文模型,顯示出比未使用信念評分的模型具有更高的學習效率。
多目標問答
在多目標問答任務中,BAIR 發現將信念狀態與推理隔離後,可以實施「峰值信念長度懲罰(PBP)」。此懲罰在最小化效能下降的情況下顯著降低記憶體使用量,這與通常在懲罰推理長度時看到的效能下降形成對比。
與替代記憶策略的比較
ABBEL 與其他長上下文管理策略在以下幾方面有所不同:
- 內容壓縮: 與密集表示不同,ABBEL 的信念狀態是自然語言且人類可理解的。
- 手動設計的提示/修剪: 與靜態提示不同,ABBEL 允許代理作為其決策策略的一部分來學習應該記住什麼。
- 外部記憶存儲: ABBEL 與 RAG 風格的外部記憶互補,因為它可以提升後續被查詢的上下文的創建。
AI 記憶的未來方向
BAIR 建議,顯式信念狀態可用於透過獎勵改善信念狀態的行為來引導探索,促進代理間的更好溝通,或允許使用者直接修改代理的記憶以獲得更好的可控性。
未來研究可能會探索結合多種記憶形式——例如工作記憶(上下文)、短期記憶和長期記憶(模型權重或適配器記憶)——來處理無法僅以文字表示的資訊或在一生互動中累積的技能。