Context Language Models (CLM)이 LLM을 위한 자체 관리형 컨텍스트를 도입하다

TL;DR

Context Language Models (CLM)은 언어 모델이 자신의 컨텍스트를 편집 가능한 파일처럼 다룰 수 있게 하여, 모델이 무엇을 유지하고 삭제하거나 업데이트할지 스스로 결정하도록 합니다. 이를 통해 벤치마크 작업에서 최대 11.4% 더 높은 정확도를 달성하면서도 FLOPs를 21.5% 절감하며, 다중 에이전트 배포를 간소화합니다.


CLM이란 무엇이며 왜 중요한가

CLM은 추론 중에 지속적인 "컨텍스트 파일"을 읽고, 쓰고, 덮어쓸 수 있는 언어 모델로, 컨텍스트 관리의 주체를 외부 코드에서 모델 자체로 전환합니다.

  • 컨텍스트 파일은 모델이 언제든지 수정할 수 있는 가변적인 토큰 시퀀스입니다.
  • 모델은 어떤 정보를 유지할 가치가 있는지 학습함으로써 불필요한 어텐션 작업을 줄입니다.
  • 이 설계는 각자 자신의 컨텍스트 파일을 소유한 여러 에이전트가 존재하는 시나리오로 자연스럽게 확장되어, 별도의 오케스트레이션 계층 없이도 조정된 다중 에이전트 추론을 가능하게 합니다.

핵심 기술적 기여

이 논문은 모델이 외부 프롬프트 없이도 호출할 수 있는 특수한 "파일 업데이트" 작업을 노출함으로써 자체 관리형 컨텍스트를 구현합니다.

  • 작업에는 제한이 없습니다: 모델은 토큰 영역을 삽입, 삭제 또는 교체할 수 있습니다.
  • 학습은 제로샷(zero-shot) 방식입니다: 기존의 사전 학습된 모델(예: Qwen3.5-9B)에 파일 업데이트 인터페이스를 래핑하여 직접 평가합니다.
  • 트랜스포머 아키텍처 변경은 필요하지 않으며, 이 메커니즘은 추론 시점에 가벼운 래퍼 형태로 추가됩니다.

기존 벤치마크에서의 실증적 성과

CLM은 훨씬 적은 연산량을 사용하면서도 최첨단 컨텍스트 관리 베이스라인을 능가합니다.

벤치마크 지표 정확도 Δ FLOPs Δ
BrowseComp-Plus 정확도 +11.4% –21.5%
12-hour EdgeBench 점수 +5.0% –59%
24-hour multi-repo swarm 개선도 +65% (동일 연산량)

저자들은 또한 표준 SGLang 서빙 스택과 비교하여, 자체 설계한 Suffix Cache Reuse 기술을 사용하여 CLM을 서빙할 때 서버 측 연산량이 35% 감소했다고 보고합니다.

내부적인 컨텍스트 관리 전략 학습

CLM은 자연어 지시사항에 의해 제어될 수 있으며, 기술 최적화 루프를 통해 개선될 수 있습니다.

  • 보상 모델이 컨텍스트 업데이트의 품질을 점수화하는 표준적인 RLHF(인간 피드백 기반 강화 학습) 스타일의 루프가 적용됩니다.
  • BrowseComp-Plus에서 온라인 RL은 Qwen3.5-9B의 성능을 47.6% 향상시키는 동시에 FLOPs를 12% 절감합니다.
  • 지시사항 튜닝된 프롬프트는 전용 컨텍스트 관리 작업에서 미학습 정확도를 최대 35.9 포인트까지 높일 수 있습니다.

서빙 최적화: Suffix Cache Reuse

Suffix Cache Reuse (SCR)는 컨텍스트 편집 후에도 변경되지 않은 KV-캐시 접미사를 재사용하여 전체 재계산을 방지합니다.

  • 기존의 KV-캐시는 프롬프트가 변경되면 전체 접미사를 무효화하여 캐시 미스 페널티를 발생시킵니다.
  • SCR은 파일 업데이트에 의해 영향을 받지 않는 토큰 위치를 추적하고 캐시된 어텐션 키/값을 재사용합니다.
  • 실제로 SCR은 베이스라인 SGLang 시스템과 동등한 수준에서 서버 측 FLOPs를 35% 감소시킵니다.

Hacker News 커뮤니티 반응

HN 토론은 열광적인 반응과 실질적인 우려를 동시에 보여줍니다.

"모델이 자신의 컨텍스트를 관리하게 하는 것은 매우 '쓴맛의 교훈(bitter-lesson)'을 담은 아이디어입니다. 접두사를 자주 편집하면 캐시 적중률이 떨어져 아키텍처 변경이 필요할 것입니다." – @jayhack

"컨텍스트 관리가 모델의 제한된 어텐션 예산을 소모하여 실제 작업을 위한 토큰이 줄어들까 걱정됩니다. 별도의 하이퍼바이저 에이전트가 이 작업을 오프로드할 수 있을 것입니다." – @bob1029

"가장 큰 발견은 그들이 일반적인 캐싱 규칙을 무시하고 유효하지 않은 캐시 접미사를 유지했음에도 성능 저하가 없었다는 점일지도 모릅니다." – @Bolwin

"컨텍스트 관리는 현대 LLM의 큰 골칫거리 중 하나이므로, 이것은 큰 의미가 있을 수 있습니다. 분명한 복잡성은 캐시 버스팅이며, 그들이 이에 대한 해결책을 연구했다는 점이 흥미롭습니다." – @svachalek

"관련 연구: Recursive Language Models (arXiv:2512.24601) 또한 자기 수정 행동을 탐구합니다." – @killerstorm

"파일을 다음 컨텍스트로 보내면 오늘날 어떤 모델로든 이 작업을 수행할 수 있지 않나요? 비용은 캐시 미스인데, CLM은 단순히 이를 무시하는군요." – @visarga

이 댓글들은 캐시 효율성과 모델이 메모리 관리를 담당해야 하는지 아니면 작업 해결에 집중해야 하는지라는 두 가지 주제로 수렴됩니다.

미해결 과제 및 향후 방향

CLM이 상용화되기 전까지 몇 가지 실질적인 과제가 남아 있습니다.

  1. 캐시 적중률: 컨텍스트 파일의 빈번한 편집은 KV-캐시 항목을 무효화하여 잠재적으로 지연 시간을 증가시킵니다. SCR이 이 문제를 완화하지만 완전히 제거하지는 못합니다.
  2. 어텐션 예산: 모델의 토큰 예산은 작업 추론과 컨텍스트 편집 간에 공유됩니다. 이 트레이드오프를 정량화하는 것은 미해결 연구 과제입니다.
  3. 다중 에이전트 조정: 논문은 에이전트별로 별도의 파일을 제안하지만, 충돌 해결 및 일관성을 위한 프로토콜은 자세히 설명되어 있지 않습니다.
  4. 하드웨어 지원: 가변 컨텍스트를 효율적으로 노출하려면 트랜스포머 커널 변경이나 전용 메모리 프리미티브가 필요할 수 있습니다.

결론

Context Language Models는 LLM에게 가변적인 컨텍스트 파일에 대한 직접적인 제어권을 부여하는 것이 정확도를 높이고 연산량을 줄일 수 있음을 보여줍니다. 하지만 이 접근 방식을 대규모로 실현하려면 캐싱, 서빙 인프라 및 다중 에이전트 조정 분야의 발전이 필요합니다.

Sources

관련