Context Language Models (CLM) 引入 LLM 的自我管理上下文
TL;DR
Context Language Models (CLMs) 允許語言模型將其上下文視為可編輯的檔案,使模型能夠決定保留、捨棄或更新哪些內容。這在基準測試任務中提升了高達 11.4% 的準確率,同時減少了 21.5% 的 FLOPs,並簡化了多代理(multi-agent)部署。
什麼是 CLM 以及為何它很重要
CLM 是能夠在推理過程中讀取、寫入和覆寫持久性「上下文檔案」的語言模型,將上下文管理從外部程式碼轉移到模型本身。
- 上下文檔案是一個可變的 Token 序列,模型可以在任何步驟對其進行修改。
- 透過學習哪些資訊值得保留,模型減少了不必要的注意力運算。
- 這種設計自然地擴展到多個代理的場景,每個代理擁有自己的上下文檔案,從而實現協調的多代理推理,而無需額外的編排層。
核心技術貢獻
該論文透過公開一個特殊的「檔案更新」操作來實現自我管理上下文,模型無需任何外部提示即可調用該操作。
- 該操作不受限制:模型可以插入、刪除或替換任何 Token 區域。
- 訓練採用零樣本(zero-shot):現有的預訓練模型(例如 Qwen3.5-9B)被封裝在檔案更新介面中並直接進行評估。
- 不需要對 Transformer 進行架構更改;該機制是作為一個輕量級的推理時封裝器添加的。
現有基準測試的實證增益
CLM 在使用顯著較少運算資源的情況下,表現優於最先進的上下文管理基準。
| 基準測試 | 指標 | 準確率 Δ | FLOPs Δ |
|---|---|---|---|
| BrowseComp-Plus | 準確率 | +11.4% | –21.5% |
| 12-hour EdgeBench | 分數 | +5.0% | –59% |
| 24-hour multi-repo swarm | 改進 | +65% (相同運算量) |
作者還報告稱,與標準的 SGLang 服務堆疊相比,在使用他們共同設計的 Suffix Cache Reuse 技術提供 CLM 服務時,伺服器端運算量減少了 35%。
內部學習上下文管理策略
CLM 可以透過自然語言指令進行引導,並透過技能優化迴圈進行改進。
- 應用了標準的從人類回饋中強化學習(RLHF)風格迴圈,其中獎勵模型對上下文更新的品質進行評分。
- 在 BrowseComp-Plus 上,線上 RL 將 Qwen3.5-9B 的效能提高了 47.6%,同時將 FLOPs 降低了 12%。
- 指令微調提示可以在專用的上下文管理任務上將保留準確率提高多達 35.9 個百分點。
服務優化:後綴快取重用 (Suffix Cache Reuse)
後綴快取重用 (SCR) 重用了上下文編輯後保持不變的 KV-cache 後綴,避免了完全重新計算。
- 傳統的 KV-cache 在提示更改時會使整個後綴失效,導致快取未命中懲罰。
- SCR 追蹤哪些 Token 位置未被檔案更新觸及,並重用其快取的注意力鍵/值。
- 在實踐中,SCR 在與基準 SGLang 系統持平的情況下,實現了伺服器端 FLOPs 35% 的減少。
Hacker News 上的社群反應
HN 的討論突顯了熱情與實際擔憂。
"讓模型管理自己的上下文是一個非常符合『苦澀的教訓』(bitter-lesson-pilled)的想法;如果你頻繁編輯前綴,快取命中率將會下降,這需要架構上的改變。" – @jayhack
"我擔心上下文管理會消耗模型有限的注意力預算,留給實際任務的 Token 會變少。一個獨立的虛擬機器監控程式代理或許可以卸載這項工作。" – @bob1029
"最大的發現可能是他們忽略了常規的快取規則並保留了無效的快取後綴,但效能並沒有受到影響。" – @Bolwin
"上下文管理是現代 LLM 遺留下來的重大麻煩之一,所以這可能意義重大。顯而易見的複雜性是快取崩潰,很高興他們研究了針對該問題的解決方案。" – @svachalek
"相關工作:Recursive Language Models (arXiv:2512.24601) 也探索了自我修改行為。" – @killerstorm
"我們現在不能透過將檔案作為下一個上下文發送來實現這一點嗎?代價是快取未命中,而 CLM 只是忽略了這一點。" – @visarga
這些評論集中在兩個主題上:快取效率以及模型應該承擔記憶體管理還是任務解決。
未決問題與未來方向
在 CLM 準備好投入生產之前,仍存在幾個實際挑戰。
- 快取命中率: 頻繁編輯上下文檔案會使 KV-cache 條目失效,可能增加延遲。SCR 緩解了但並未消除該問題。
- 注意力預算: 模型的 Token 預算在任務推理和上下文編輯之間共享;量化這種權衡是一個開放的研究問題。
- 多代理協調: 雖然該論文提出了每個代理使用單獨檔案的方案,但衝突解決和一致性的協定尚未詳細說明。
- 硬體支援: 有效地公開可變上下文可能需要更改 Transformer 核心或專用的記憶體原語。
總結
Context Language Models 證明了賦予 LLM 對可變上下文檔案的直接控制權可以提高準確率並減少運算量,但要大規模實現該方法,將需要快取、服務基礎設施和多代理協調方面的進步。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch