LLM 아키텍처의 증가하는 복잡성

현대의 대형 언어 모델(LLM)은 간단하고 반복되는 Transformer 모듈에서 매우 복잡하고 하이브리드한 아키텍처로 진화하고 있다. 이 변화는 모델 성능 향상의 필요성과 추론 효율성에 대한 엄격한 요구 사항 사이의 긴장에 의해 주도되며, 이는 이전에 추천 시스템(recsys) 개발에서 관찰된 패턴이다.

단순에서 복잡한 아키텍처로의 전환

초기 LLM, 예를 들어 원래 Llama 시리즈는 반복되는 Transformer 모듈의 '깨끗하고 부드러운 스택'으로 특징지어졌다. 그러나 현재 최첨단 모델은 성능과 효율성을 최적화하기 위해 상당한 구조적 복잡성을 도입했다.

주요 아키텍처 추가 사항은 다음과 같다:

  • Attention Variants: 모델은 현재 쿼리 그룹화, 압축, 희소, 선형, 슬라이딩 윈도우 주의 메커니즘을 포함한 다양한 주의 메커니즘을 사용한다.
  • Selective Routing: Mixture-of-Experts (MoE)는 피드-포워드 레이어에 라우팅을 도입했으며, 현재 라우팅이 주의 블록과 잔차 스트림에 적용되고 있다.
  • Integrated Modalities: 비전 및 오디오 인코더는 이제 단순히 '볼트 온'이 아니라 모델 아키텍처에 직접 통합된다.
  • Distributed Inference: 여러 GPU에 걸쳐 모델을 확장하면 통신 연산(comms ops)이 도입되어 모델 구조 내에 추가적인 경계가 생성된다.

추천 시스템(Recsys)과의 유사점

LLM의 진화는 추천 시스템의 궤적을 반영한다. 거의 10년 동안 기본 recsys 아키텍처는 단순한 두 타워 희소 신경망이었다. 시간이 지나면서 이러한 시스템은 성능 최적화가 선택적 개선이 아니라 필수적인 부하가 되면서 '끔찍하게' 복잡해졌다.

recsys에서 최적화와 필수 요소 사이의 격차는 매우 작아졌다. 마찬가지로 LLM 개발에서 연구 반복 루프는 다른 종류의 유연성을 요구한다. 연구자가 한 주의 변형을 다른 것으로 교체하고 싶다면, 새로운 변형은 적어도 부분적으로 최적화되어야(예: 융합) 추가 탐색의 계산 비용이 worthwhile한지 판단할 수 있다. 효율성의 기준이 없으면, 최적화되지 않은 변형의 성능 패널티는 한 자리 수 정도 더 나빠질 수 있어 모델의 실행 가능성을 평가하기 불가능하게 만든다.

구성 가능성과 도구의 역할

수동 커널 융합의 함정과 반복 불가성을 피하기 위해 산업은 구성 가능성을 위한 설계로 이동하고 있다.

PyTorch의 FlexAttention

PyTorch의 FlexAttention은 이 문제에 대한 성공적인 접근 방식의 주요 예로 인용된다. 이는 Triton 템플릿을 통해 개발자가 주의 작업의 넓은 범위에 대한 커널을 생성할 수 있게 한다. 주의 작업을 사전에 구성 가능하고 검증 가능하게 만들면, FlexAttention은 연구자들이 성능에만 미미한 영향을 주면서 새로운 아키텍처를 탐색할 수 있게 하여, 매번 새로운 실험마다 커널을 수동으로 융합할 필요를 피하게 한다.

에이전트 연구의 한계

AI 에이전트(예: "Claude Telenovela))가 결국 최적으로 융합된 커널 생성을 자동화할 것이라는 유혹이 있지만, 이는 출력을 검증할 수 있는 고정되고 사용 가능한 기준이 존재할 때만 가능하다. 아키텍처를 핵심으로 축소하고 구성 가능성을 유지하는 능력은 연구 루프를 자동화하는 데 사용되는 에이전트 설정과 마찬가지로 최전선 연구에 있어 중요하다.

커뮤니티 관점

이 아키텍처 변화에 대한 논의는 머신러닝 엔지니어링의 더 넓은 추세를 강조한다.

"특성 공학 생명 주기의 쓴 교훈이다. 기술이나 기술이 새로울 때 사람들은 단순히 일부 사용 사례에 적용함으로써 큰 이익을 얻는다... 시간이 지나면서 이러한 '쓴 교훈' 이득은 로지스트 곡선의 얕은 부분에 도달하기 시작하고, 기업들은 각 작은 점진적 이득에 대해 점점 더 많은 엔지니어링 노력에 투자해야 한다.

일부 비평가들은 Llama 3 대 Nemotron 3 Ultra와 같은不同的 LLM 가족 간 비교가 같은 가족 내 모델을 비교하여 어떻게 진화했는지 보는 것보다 덜 설명적일 수 있다고 주장하지만, 주요 차이점이 종종 피드-포워드 레이어를 MoE로 대체하고 다른 주의 구현으로 귀결된다는 점을 인정한다.

Sources