왜 압축과 대규모 언어 모델은 같은 예측 문제를 해결하는가

압축과 LLM은 같은 예측 문제이다

핵심 포인트: 현대의 무손실 압축기와 대규모 언어 모델(LLM)은 모두 데이터의 확률 모델을 구축하고, 그 모델을 사용해 다음 기호를 예측하며, 엔트로피 인코더로 데이터를 인코딩한다. 예측이 더 정확할수록 필요한 비트 수가 줄어든다.


전통적 압축의 작동 방식

  • 변환(예: 런 렝스 인코딩)은 중복을 드러내기 위해 데이터를 재정렬하지만, 파일 크기를 직접 줄이지는 않을 수 있다.
  • 모델은 관측된 빈도나 맥락에 기반해 각 가능한 기호에 확률을 부여한다. 문자열 AAAAAA BBB C에 대해 단순한 모델은 확률 A:0.71, B:0.21, C:0.07을 산출한다.
  • 엔트로피 인코더(산술 또는 허프만)는 이러한 확률을 샤논 엔트로피 -∑p·log₂p에 가까운 길이의 비트 스트림으로 변환한다.

"엔트로피는 바닥선이다 – 손실 없이 달성 가능한 최소 비트 수(기호당)." – Ngrok 블로그

확률이 중요한 이유

  • 높은 확률을 가진 기호는 더 적은 비트를 필요로 한다(bits = -log₂(p)).
  • 비대칭 분포는 더 잘 압축된다: A로 구성된 문자열(p≈0.83)은 평균적으로 0.82 비트/기호를 사용하지만, 균형 잡힌 문자열은 평균적으로 1.38 비트/기호를 사용한다.
  • 맥락(1차, 2차 모델)을 추가하면 확률이 크게 정밀해진다. 1차 모델은 문장 "TO BE OR NOT TO BE"의 압축 크기를 약 47비트에서 약 21비트로 줄였다.

언어 모델링을 압축으로 보는 시각

  • LLM은 이전 맥락을 기반으로 다음 토큰에 대한 확률 분포를 생성한다 — 압축기의 모델 단계와 정확히 일치한다.
  • 진짜 다음 토큰이 가장 높은 확률 예측과 일치하면 인코더는 단지 -log₂(p) 비트만 소비한다. 예측이 틀리면 비트 비용이 증가한다.
  • 산술 인코딩은 토큰 스트림에 적용할 수 있으며, 잘 훈련된 LLM을 거의 최적의 압축기로 만들 수 있다. 디킨스의 인용문에 대한 테스트에서 GPT-2 모델은 176비트(원본의 10%)를 달성했으며, 단순한 1차 모델(434비트, 24%)보다 훨씬 우수했다.

"LLM을 훈련하는 것은 거대하고 파라미터화된 압축 알고리즘을 최적화하는 것과 같다(교차 엔트로피 손실은 샤논 엔트로피와 동일한 공식이다)." – Ngrok 블로그

실용적 한계

  • 모델 크기 vs. 페이로드: HTTP 응답을 압축하기 위해 수기가의 LLM을 배포하면 절약되는 킬로바이트보다 더 큰 부담이 된다.
  • 계산 비용: 트랜스포머를 사용한 인코딩/디코딩은 gzip이나 Brotli보다 수십 배 이상 느리고 에너지 소모가 크다.
  • 따라서 LLM은 의미적 압축(예: 프롬프트 요약)에는 유용하지만, 일반적인 바이트 수준 압축에는 적합하지 않다.

커뮤니티의 시각

farfatched: "정보 이론, 추론, 학습은 동전의 양면이다; 뇌는 궁극적인 압축기다." ssivark: "학습 분포가 테스트 분포와 정확히 일치할 때만 압축은 예측과 같다; 그렇지 않으면 일반화가 분리된다." variadix: "비-LZ 압축기는 암묵적으로 확률 분포를 모델링한다; 각 출력 기호의 길이는 그 확률에 대응한다." throwaway_7274: "훈련을 압축기의 가족에 대한 최적화로 보는 시각은 새로운 아이디어의 등장 가능성을 설명할 수 있다." zephen: "압축은 예측을 필요로 하지만, 이는 압축이 예측이라는 의미는 아니다; 방향성이 중요하다." j-pb: "세 번째 요소인 인덱싱은 압축, 예측, 검색 구조의 삼위일체를 완성한다." rrherr: "슈마이드후버의 2008년 논문은 최근의 화제보다 훨씬 이전부터 압축 진보와 호기심 및 창의성의 관계를 연결했다." sethev: "허터 상은 압축을 지능의 대리 지표로 명시적으로 다루며, 압축-예측 연결을 강화한다." sigbottle: "소로몬오프 유도는 자원 제약 없이 완벽한 압축은 공허하다는 것을 보여준다; 실제 압축기는 유용하기 위해 충분히 작아야 한다." Lerc: "예측은 오차만 인코딩하게 하지만, 압축기는 순차적으로 보이지 않는 전역 패턴도 활용할 수 있으므로, 동등성은 엄격하지 않다." zhxiaoliang: "압축은 예측 가능성을 활용하지만, 지능은 유용한 예측을 창출한다 — 중요한 개념적 차이점이다." jdthedisciple: "예측 가능성은 정보의 역수이다; 정보가 낮을수록 압축이 높아지며, 이는 기본적인 정보 이론이다." e12e: "gzip은 언어 모델로 사용될 수 있으며, 고전적 압축기가 이미 다음 토큰 예측을 수행하고 있음을 보여준다."


결론

  • 수학적 동일성: 무손실 압축기와 LLM은 모두 동일한 목적을 최소화한다 — 교차 엔트로피(음의 로그 가능도), 이는 기호당 평균 비트 수와 같다.
  • 실용적 차이점: 압축기는 속도, 작은 모델, 결정론적 디코딩을 위해 설계되었지만, LLM은 표현력과 장거리 의존성을 우선시하지만 막대한 자원 비용이 따른다.
  • 미래 방향성: 압축 개선은 더 나은 예측 모델에 달려 있다. LLM이 계속 발전함에 따라, 그들은 점점 더 의미적 압축기로 활용될 것이며, 전통적인 바이트 수준 압축기는 저부하 데이터 전송의 주력 도구로 남을 것이다.

빠른 참고 표

구성 요소 압축 LLM 역할
모델 확률 표(일반적으로 맥락 인식) 토큰 확률을 출력하는 트랜스포머 다음 기호 예측
엔트로피 인코더 산술/허프만 → 비트 스트림 동일한 인코더를 토큰 확률에 적용 가능 확률을 비트로 변환
목표 비트/기호 최소화(엔트로피에 접근) 교차 엔트로피 손실 최소화(동일한 지표) 더 나은 예측 → 더 나은 압축

요약하면, 어떤 무손실 압축기의 핵심은 예측기이다. 현대의 LLM은 단지 훨씬 더 강력한 예측기일 뿐이며, 이 때문에 엔트로피 인코더와 함께 사용할 때 우수한 압축 성능을 달성한다. 그러나 실용적 제약으로 인해 대부분의 엔지니어링 파이프라인에서는 서로 분리되어 있다.

Sources

관련

  • Dispatch
  • 프로젝트
  • 프로젝트
  • Dispatch
  • Dispatch