上下文语言模型 (CLM) 为大语言模型引入了自我管理的上下文
TL;DR
上下文语言模型 (CLMs) 允许语言模型将其上下文视为一个可编辑的文件,使模型能够决定保留、丢弃或更新哪些内容。在基准测试任务中,这不仅提升了高达 11.4% 的准确率,还减少了 21.5% 的 FLOPs,并简化了多智能体部署。
什么是 CLM 及其重要性
CLM 是能够在推理过程中读取、写入和覆盖持久化“上下文文件”的语言模型,将上下文管理从外部代码转移到了模型自身。
- 上下文文件是一个可变的标记序列,模型可以在任何步骤对其进行修改。
- 通过学习哪些信息值得保留,模型减少了不必要的注意力计算工作。
- 这种设计自然地扩展到了涉及多个智能体的场景,每个智能体拥有自己的上下文文件,从而在无需额外编排层的情况下实现协调的多智能体推理。
核心技术贡献
该论文通过公开一个特殊的“文件更新”操作实现了自我管理的上下文,模型无需任何外部提示即可调用该操作。
- 该操作不受限制:模型可以插入、删除或替换任何标记区域。
- 训练是零样本的:现有的预训练模型(例如 Qwen3.5‑9B)被封装在文件更新接口中并直接进行评估。
- 无需对 Transformer 进行架构更改;该机制作为轻量级的推理时包装器添加。
在既定基准测试上的实证收益
CLM 在使用显著较少计算资源的情况下,超越了最先进的上下文管理基准。
| 基准测试 | 指标 | 准确率 Δ | FLOPs Δ |
|---|---|---|---|
| BrowseComp‑Plus | 准确率 | +11.4% | –21.5% |
| 12‑hour EdgeBench | 分数 | +5.0% | –59% |
| 24‑hour multi‑repo swarm | 改进 | +65% (相同计算量) |
作者还报告称,与标准的 SGLang 服务堆栈相比,在使用其共同设计的 Suffix Cache Reuse 技术提供 CLM 服务时,服务器端计算量减少了 35%。
内部学习上下文管理策略
CLM 可以通过自然语言指令进行引导,并通过技能优化循环进行改进。
- 应用了标准的从人类反馈中强化学习 (RLHF) 风格的循环,其中奖励模型对上下文更新的质量进行评分。
- 在 BrowseComp‑Plus 上,在线 RL 将 Qwen3.5‑9B 的性能提高了 47.6%,同时减少了 12% 的 FLOPs。
- 指令微调提示可以将专用上下文管理任务上的留出准确率提高多达 35.9 个百分点。
服务优化:后缀缓存重用
后缀缓存重用 (SCR) 重用了上下文编辑后保持不变的 KV‑cache 后缀,避免了完全重新计算。
- 传统的 KV‑cache 在提示更改时会使整个后缀失效,导致缓存未命中惩罚。
- SCR 跟踪文件更新未触及的标记位置,并重用其缓存的注意力键/值。
- 在实践中,SCR 在与基准 SGLang 系统持平的情况下,实现了 35% 的服务器端 FLOPs 减少。
Hacker News 上的社区反应
HN 的讨论既突出了热情,也提出了实际担忧。
"让模型管理自己的上下文是一个非常符合‘苦涩教训’的想法;如果你频繁编辑前缀,缓存命中率将会下降,这需要架构上的改变。" – @jayhack
"我担心上下文管理会消耗模型有限的注意力预算,从而留给实际任务的标记变少。一个单独的虚拟机管理程序智能体可以卸载这项工作。" – @bob1029
"最大的发现可能是他们忽略了常规的缓存规则并保留了无效的缓存后缀,但性能并没有受到影响。" – @Bolwin
"上下文管理是现代大语言模型遗留的重大麻烦之一,所以这可能意义重大。显而易见的复杂性是缓存失效,很高兴他们研究了解决方案。" – @svachalek
"相关工作:递归语言模型 (arXiv:2512.24601) 也探索了自我修改行为。" – @killerstorm
"我们今天不能通过将文件作为下一个上下文发送给任何模型来做到这一点吗?代价是缓存未命中,而 CLM 只是忽略了这一点。" – @visarga
这些评论集中在两个主题上:缓存效率以及模型应该承担内存管理还是任务解决。
开放性问题与未来方向
在 CLM 准备好投入生产之前,仍存在一些实际挑战。
- 缓存命中率: 对上下文文件的频繁编辑会使 KV‑cache 条目失效,可能增加延迟。SCR 缓解了但并未消除该问题。
- 注意力预算: 模型的标记预算在任务推理和上下文编辑之间共享;量化这种权衡是一个开放的研究问题。
- 多智能体协调: 虽然论文提出了每个智能体使用单独文件的方案,但冲突解决和一致性的协议尚未详细说明。
- 硬件支持: 有效地公开可变上下文可能需要更改 Transformer 内核或专用的内存原语。
总结
上下文语言模型证明,让大语言模型直接控制可变的上下文文件可以提高准确性并减少计算量,但要大规模实现这一方法,将需要缓存、服务基础设施和多智能体协调方面的进步。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch