11월의 변곡점: LLM 진화의 6개월

대규모 언어 모델(LLM)의 지형은 전통적인 소프트웨어 주기와 비교하면 매우 느리게 느껴질 정도로 빠른 속도로 움직입니다. 최근 회고에서 Simon Willison은 그가 "November Inflection Point"라고 정의한 2025년 11월부터 2026년 5월까지의 중요한 시기를 강조했습니다. 이 기간은 단순한 모델 출시의 연속 그 이상을 의미합니다. 이는 개발자가 AI와 상호작용하는 방식이 실험적인 보조 도구에서 신뢰할 수 있는 일상적인 생산성 도구로 이동하는 근본적인 변화를 나타냅니다.

"최고" 모델을 향한 전쟁

지난 6개월 동안 가장 눈에 띄는 측면 중 하나는 리더보드의 변동성이었습니다. 2025년 11월과 12월 사이, Anthropic, OpenAI, Google 등 세 주요 제공업체 사이에서 "최고" 모델의 타이틀이 다섯 번이나 바뀌었습니다.

Claude Sonnet 4.5로 시작하여, 왕좌는 GPT-5.1로, 그다음은 Gemini 3, 그다음은 GPT-5.1 Codex Max로 이동했다가, 마침내 Claude Opus 4.5에 안착했습니다. 이러한 급격한 변동은 추론이나 코딩 능력의 미세한 이득이 몇 달이 아닌 몇 주 단위로 출시되고 있음을 시사하는 초경쟁 상태를 나타냅니다.

이러한 미세한 차이를 추적하기 위해 Willison은 독특하고 관습에 얽매이지 않는 벤치마크를 사용합니다: 자전거를 타는 펠리컨의 SVG를 생성하는 것입니다. 이 테스트는 펠리컨이 자전거를 타는 모습이 기존 데이터셋에서 흔한 모티프가 아니기 때문에 학습 데이터 오염을 피하기 위해 설계되었습니다. 결과는 명확한 개선 궤적을 보여주었으며, Gemini 3.1 ProGLM-5.1이 이 초현실적인 작업의 매우 유능하고 심지어 애니메이션 버전까지 생성하는 정점에 도달했습니다.

코딩 에이전트의 부상

"분위기 기반" 리더보드가 화려하긴 하지만, 실제 기술적 돌파구는 2025년 11월에 일어났습니다: 코딩 에이전트가 진정으로 유용해졌습니다.

이 도약은 주로 **Reinforcement Learning from Verifiable Rewards (RLVR)**에 의해 주도되었습니다. 코드가 실제로 컴파일되거나 테스트 스위트를 통과하는지와 같은 검증 가능한 결과에 대해 모델을 학습시킴으로써, OpenAI와 Anthropic은 모델을 중요한 품질 장벽 너머로 밀어붙였습니다. 코딩 에이전트는 "자주 작동하는" 수준에서 "대부분 작동하는" 수준으로 전환되었으며, 이를 통해 개발자가 사소한 오류를 수정하는 데 대부분의 시간을 소비하지 않고도 이를 주요 도구로 사용할 수 있게 되었습니다.

"Claw" 현상

이 새로운 에이전트 기능은 OpenClaw 프로젝트에 의해 촉발된, 속칭 "Claws"라고 불리는 새로운 범주의 개인용 AI 어시스턴트의 탄생을 가져왔습니다. 이 트렌드는 매우 널리 퍼져서, 사용자들이 이러한 로컬 에이전트를 실행하기 위해 하드웨어를 구매하면서 실리콘밸리에서 Mac Mini가 품절되는 현상까지 보고되었습니다.

하지만 커뮤니티는 이러한 에이전트의 장기적인 생생력에 대해 의견이 갈리고 있습니다. 일부 사용자는 AI가 코드의 90%를 작성하는 "사이버네틱 혼합" 작업 방식을 보고하고 있지만, 다른 이들은 에이전트가 여전히 복잡하고 완전한 애플리케이션을 구축하는 데 어려움을 겪으며, 수정 중인 소프트웨어 아키텍처에 대한 깊은 있는 이해가 부족하다고 주장합니다.

로컬 모델 혁명

지난 6개월 동안의 또 다른 지배적인 테마는 오픈 웨이트(open-weight) 및 로컬 모델의 예상치 못한 성능입니다.

  • Gemma 4: Google의 최신 시리즈는 미국 기업의 오픈 웨이트 모델 중 가장 유능한 모델 중 하나로 주목받고 있습니다.
  • GLM-5.1: 중국의 거대한 1.5TB 오픈 웨이트 모델로, 사용자가 이를 지원할 수 있는 하드웨어를 보유하고 있다면 매우 높은 효과성을 보여줍니다.
  • Qwen 3.6: 노트북에서 실행할 수 있는 작은 모델(35B)임에도 불구하고 특정 창의적인 코딩 작업에서 일부 프론티어 모델을 능재합니다.

이는 독점적 프론티어 모델과 로컬 모델 사이의 격차가 좁아지고 있음을 시사하며, 더 많은 개인정보 보호 중심적이고 비용 효율적인 배포를 가능할 수하게 합니다.

비판적 관점 및 한계

이러한 흥미로움에도 불구하고, 기술 비평가들은 현재 LLM 아키텍처의 근본본적인 한계점을 지적합니다. 커뮤니티에서 반복되는 의견은 LLM이 "마법사 수준의 코드 도우미"는 되고 있지만, 여전히 내재적 이해가 부족하다는 것입니다.

"AI는 오리가 무엇인지, 그 구성 요소가 무엇인지, 또는 어떻게 오리를 만들었는지 완전히 이해하지 못합니다... 그저 오리를 '주문'하는 법을 알 뿐입니다. 이는 AI에게 적절한 문서를 작성하도록 시도할 때 매우 명명백백하게 드러납니다. 직접적인 가이드라인을 제공하더라도 매우 처참하게 실패합니다."

패턴 합성내재적 이해 사이의 이점은 주요 논쟁점입니다. RLVR을 통해 모델이 컴파일되는 코드를 생성하는 데 탁월해졌지만(컴파일러가 검증 가능한 보리을 제공하기 때문), 이것이 반드시 AI가 비즈니스 로직이나 구현 뒤의 "왜"를 이해한다는 것을 의미하지는 않습니다.

6개월간의 변화 요약

테마 이전 상태 변곡점 이후 상태
코딩 에이전트 실험적, 과도한 관리가 필요함 일상적인 도구, 프로덕션에 대부분 신뢰할 수 있음
모델 도미넌스 몇 달 동안 안정적인 리더십 유지 "최고" 모델의 급격한 주간 단위 변동
로컬 모델 프론티어 모델보다 현저히 약함 기대를 훨씬 뛰어넘는 성능
훈련ing Focus 일반적인 텍스트 예측 RLVR (Verifiable Rewards)

Sources