ZAYA1-8B: 760M 활성 파라미터로 DeepSeek-R1 수학 성능 달성

대형 언어 모델(LLM) 효율성에 대한 추구는 오랫동안 파라미터 수와 실제 성능 사이의 줄다리기였습니다. 업계가 거대한 모델 쪽으로 흐르는 동안, 고효율·소형 모델에 대한 새로운 전환이 나타나고 있습니다. ZAYA1-8B는 이 방향에서 중요한 이정표를 제시하며, 760 백만 활성 파라미터만으로 DeepSeek-R1과 동등한 수학 작업 성능을 달성한다고 주장합니다.

이 모델은 "더 큰 것이 더 좋다"는 신조가 건축적 혁신, 특히 전문가 혼합(MoE)과 새로운 추론 트레이스 관리 방식을 통해 도전받고 있음을 보여줍니다.

아키텍처: MoE와 Markovian RSA

핵심적으로 ZAYA1-8B는 8 B 파라미터 전문가 혼합 모델입니다. 여기서 중요한 차별점은 활성 파라미터의 수—단일 순전파 동안 실제로 사용되는 모델 부분—입니다. 활성 파라미터를 760 M으로 유지함으로써, 이 모델은 일반 하드웨어와 로컬 환경에서도 배포가 가능한 수준의 계산 효율성을 달성합니다.

ZAYA1-8B의 가장 흥미로운 기술적 측면 중 하나는 Markovian RSA의 구현입니다. 이 접근법은 두 가지 별도 방법론을 합성한 것입니다:

  1. Reasoning-Step Analysis (RSA): 주어진 프롬프트에 대해 일련의 추론 트레이스를 생성해 해결책까지의 논리적 경로를 매핑합니다.
  2. The Markovian Thinker: 이 메커니즘은 추론 트레이스의 길이를 관리해 컨텍스트 윈도우를 유지 가능하게 합니다. 트레이스 끝부분에서 조정 가능한 양($\tau$)의 토큰을 잘라내는 방식으로 수행됩니다.

지도 학습 미세조정(SFT) 단계에서 모델은 트레이스의 끝부분에 가장 관련성 높은 정보를 집중하도록 훈련됩니다. 이는 트리밍 과정이 중요한 논리적 도약을 버리지 않도록 보장합니다. 그러나 이러한 설계 선택은 관찰자들 사이에서 기술적 논쟁을 일으켰으며, 일부는 단순히 트레이스 끝에서 토큰을 잘라내는 것이 통찰을 보존하는 가장 효율적인 방법인지, 혹은 트레이스 초반에 중요한 정보가 손실될 가능성이 있는지를 의문시합니다.

실제 성능 및 활용도

벤치마크는 수학 분야에서 DeepSeek-R1과 동등한 수준을 시사하지만, 사용자 경험은 코딩 및 에이전시 작업에서의 능력을 보다 미묘하게 보여줍니다.

코딩 능력

초기 테스트 사용자들은 모델이 코딩에서 "대략 경쟁력 있다"고 보고했습니다. 실제 테스트—예를 들어 브라우저 콘솔에서 실행할 수 있는 기능성 타이머를 위한 JavaScript 코드를 생성하는 경우—에서 모델은 작동하는 코드를 성공적으로 만들어냈지만, 원하는 결과에 도달하기 위해 추가적인 수정 프롬프트가 필요했습니다. 이는 모델이 크기 대비 높은 능력을 가지고 있지만, 복잡한 소프트웨어 엔지니어링 작업에서 Claude나 GPT‑4와 같은 최첨단 모델을 바로 대체하기엔 아직 부족함을 시사합니다.

에이전시 격차

모델의 수학적 추론과 에이전시 성능 사이에는 뚜렷한 차이가 있습니다. 일부 비평가들은 수학과 코딩은 인상적이지만, 도구 호출을 사용해 컨텍스트를 수집하고 해결책을 실행하는 에이전시 능력—특히 도구 활용 능력—이 덜 발달했다고 주장합니다. 이는 모델이 독점적인 코딩 어시스턴트를 대체하려면 극복해야 할 중요한 장애물입니다.

로컬 LLM에 대한 더 넓은 함의

ZAYA1-8B의 출시 자체가 AI 민주화라는 더 넓은 흐름을 나타냅니다. 760 M 활성 파라미터만으로 복잡한 수학 및 코딩 작업을 인터넷 연결 없이 데스크톱에서 실행할 수 있다는 점은 프라이버시를 중시하는 개발자와 연구자에게 매력적인 전망을 제공합니다.

커뮤니티가 관찰하듯, 10 T 파라미터 모델을 이끌어낸 스케일링 법칙은 지속 가능하지 않을 수 있습니다. 이제는 얼마나 많은 정보를 압축할 수 있는지, 그리고 작은 모델에서 검색 기반 추론을 얼마나 효과적으로 구현할 수 있는지가 초점이 되고 있습니다. Zyphra와 같은 연구소와 AMD와 같은 하드웨어 제공업체의 참여는 최첨단(SOTA) 성능을 일반 하드웨어에서도 접근 가능하게 만들려는 생태계가 성장하고 있음을 보여줍니다.

"나는 작은 모델이 LLM의 미래라고 생각한다... 2년 안에 일반 하드웨어와 인터넷 연결 없이 데스크톱에서 몇 가지 모델만으로 다양한 작업을 수행할 수 있다는 것에 정말 놀랄 수도 있다."

전체 파라미터와 활성 파라미터 사이의 균형을 최적화함으로써, ZAYA1-8B는 고급 추론 능력이 비싼 API 호출 뒤에 가려지는 것이 아니라 효율적인 로컬‑우선 아키텍처에 분산될 수 있는 미래를 열어갑니다.


SUMMARY: ZAYA1-8B는 Markovian RSA를 활용한 전문가 혼합 모델로, 작은 효율적인 규모에서도 고성능 수학 및 코딩 능력을 제공한다는 탐구.

TITLE: ZAYA1-8B: 760M 활성 파라미터로 DeepSeek-R1 수학 성능 달성

Sources