Subquadratic와 1200만 토큰 컨텍스트 윈도우를 향한 여정

컨텍스트 윈도우의 제한은 오랫동안 대규모 언어 모델(LLM)의 유용성을 저해하는 주요 병목 현상 중 하나였습니다. 수천 개의 토큰에서 Gemini와 같은 모델이 제공하는 백만 토큰 윈도우로 꾸준히 상승하는 것을 보아왔지만, Subquadratic의 1200만 토큰 윈도우 발표는 AI가 방대한 데이터셋과 상호작용하는 방식을 근본적으로 바꿀 수 있는 이론적 도약을 의미합니다.

컨텍스트 윈도우를 확장하는 것은 단순히 메모리를 추가하는 문제가 아닙니다. 이는 입력 길이가 길어짐에 따라 계산 비용이 기하급수적으로 증가하는 전통적인 어텐션 메커니즘의 이차 함수적 스케일링 법칙(quadratic scaling laws)을 극복하는 것에 관한 것입니다. 12M 토큰 윈도우는 공격적인 RAG(Retrieval-Augmented Generation)나 손실 압축을 필요로 하지 않고도 전체 코드베이스, 방대한 기술 라이브러리 또는 수천 페이지의 문서를 수용할 수 있게 해주는 subquadratic 아키텍처로의 전환을 시사합니다.

기술적 회의론

12M 토큰 주장의 화제성에도 불구하고, 기술 커뮤니티는 여전히 신중한 태도를 유지하고 있습니다. 개발자와 연구자들 사이에서 반복되는 주제는 공식적인 기술 보고서나 모델 카드가 없다는 점입니다. AI 연구 분야에서 이 정도 규모의의 주장은 일반적으로 이러한 극단적인 규모에서도 모델이 "needle-in-a-haystack" 검색 정확도를 유지한다는 것을 증명하기 위해 피어 리뷰를 거친 논문이나 아키텍처에 대한 상세한 분석이 동반됩니다.

비판론자들은 발표된 방법론이 없다면 모델이 실제로 1200만 토큰을 처리하는지, 아니면 정밀도를 희생하는 영리한 압축 기술을 사용하는지 확인하기 어렵다고 지적합니다. 한 관찰자는 다음과 같이 언급했습니다:

"No technical report published yet, unlikely code or weights will be either given VC funding."

잠재적 아키텍처: Sparse Attention 및 그 이상

Subquadratic가 그들의 접근 방식에 대한 세부 사항을 공개하지 않았지만, 업계의 추측은 그들이 다른 고효율 모델에서 볼 수 있는 것과 유사한 기술을 활용하고 있을 가능성을 시사합니다. 한 가지 가능성은 DeepSeek가 취한 방식과 유사하게 콘텐츠 기반의 입도(granularity)를 가진 네이티브 sparse attention을 사용하는 것입니다.

Sparse attention은 모든 토큰이 시퀀스 내의 다른 모든 토큰에 주의를 기울일 필요가 없도록 보장함으로써 계산 부하를 줄입니다. 대신, 모델은 가장 관련 있는 토큰에 집중하여 어텐션 메커니즘을 효과적으로 "압축"합니다. 이는 표준 Transformer의 $O(n^2)$ 복잡도에서 더 선형적이거나 로그 형태의 복잡도로 이동하려는 목표를 가지므로 "subquadratic"라는 명칭의 근거가 될 수 있습니다.

방대한 컨텍스트의 실질적 유용성

1200만 토큰이 대부분의 실제 응용 분야에서 실제로 필요한지에 대해서는 지속적인 논쟁이 있습니다. 많은 개발자에게 현재의 제한은 이미 충분합니다. 예를 들어, Claude Code와 같은 AI 기반 코딩 에이전트의 경우, 100만 토큰 윈도우는 대부분의 활성 프로젝트 파일을 처리하는 데 충분한 경우가 많습니다.

하지만, 12M 윈도우의 가치는 특정 고위험 환경에서 분명해집니다:

  • 법률 및 컴플라이언스: 단 한 번의 패스로 수천 페이지의 판례법이나 규제 문서를 분석합니다.
  • 대규모 소프트웨어 엔지니어링: 파편화된 RAG 청크에 의존하지 않고 모듈 간 의존성을 이해하기 위해 전체 모놀리식 리포지토리를 수용합니다.
  • 과학 연구: 비자명한 상관관계를 찾기 위해 전체 게놈 시퀀스나 방대한 연구 논문 세트를 처리합니다.

결론: 약속보다는 증명

Subquadratic의 발표는 LLM 메모리의 미래에 대한 필요한 대화를 촉를합니다. 만약 12M 토큰 윈도々가 실행 가능하고 유지 가능할 경우, 모델이 관련 데이터의 전체 우주를 활성 메모리에 보유할 수 있게 함으로써 현재의 많은 RAG 아키텍처를 구식으로 만들 수 있습니다. 하지만 기술 논문이 발표될 때까지 업계는 이를 입증된 기술적 돌파구라기보다는 마케팅적 이정표로 간주할 가능성이 높습니다.

Sources