Z.AI Ox Alpha: 오픈 가중치를 갖춘 새로운 GLM 시리즈 모델

Z.AI, Ox Alpha가 GLM 시리즈 모델임을 공식 확인

중국 기반의 Z.AI Co. (또는 지푸)는 Ox Alpha 모델이 자체 GLM 시리즈의 새로운 버전임을 공식적으로 확인했다. 2026년 8월 26일 블룸버그 뉴스의 문의에 응답하며, 회사는 모델의 가중치를 공개할 계획임을 발표하며, Ox Alpha를 DeepSeek과 같은 다른 오픈 가중치 모델과 경쟁할 수 있는 고성능 모델로 위치지었다.

초기 사용자 성능 및 기능

OpenRouter 및 OpenCode Zen과 같은 플랫폼을 통해 Ox Alpha에 접근한 사용자들의 초기 보고에 따르면, 강력한 코딩 능력을 갖추고 있지만, 주목할 만한 안정성 문제도 존재한다.

코딩 및 기술 작업

  • Java 바인딩: 한 사용자는 모델이 단일 턴 내에 약 10만 개의 입력 토큰, 6만 개의 출력 토큰, 8만 개의 사고 토큰을 사용해 latticedb 프로젝트에 대한 Java 바인딩을 성공적으로 생성했다고 보고했다.
  • UI 개발: 일부 사용자는 Ox Alpha가 GPT 5.6 Sol보다 UI 작업에서 특히 뛰어나다고 평가했다.
  • 일반적인 코딩: 사용자들은 이 모델의 코딩 성능이 앤트로픽의 Sonnet과 Opus 모델 사이에 있다고 설명하며, 깔끔한 코드를 작성하고 맥락을 잘 유지한다고 평가했다.

안정성 및 신뢰성 문제

기능적인 측면에서는 초기 테스터들이 심각한 신뢰성 문제를 지적했다:

  • 무한 루프: 여러 사용자가 모델이 "도움이 되지 않는 루프"에 빠지며, 동일한 bash 명령어를 수천 번 반복 실행하는 현상을 보고했다. 이는 자동화된 에이전트 워크플로우에 무단으로 사용하기에 부적합하다.
  • 복잡한 스크립팅: 파이프라인을 포함한 복잡한 bash 스크립트 처리에서 모델이 "줄을 놓는다"는 보고가 있었다.
  • 추론 속도: 초기 접근 사용자들은 추론 속도가 매우 낮아 자주 타임아웃이 발생한다고 지적했다.

커뮤니티 분석 및 추측

허커 뉴스의 기술 관찰자들은 모델의 아키텍처와 위치에 대해 여러 질문을 제기했다:

  • 모델 크기: 모델의 파라미터 수에 대한 관심이 크다. 분석가들은 모델이 GLM 5.3과 유사한 크기라면 효율성 측면에서 큰 도약을 의미하며, DeepSeek Pro나 Kimi K3에 가까운 크기라면 경쟁력은 있지만 차별화된 점은 적다고 본다.
  • 벤치마킹 불일치: 사용자들은 공개 벤치마크에서 혼란스러운 신호를 발견했다. 일부 보고서는 LiveBench에서 GPT-5.4 Nano보다 성능이 낮다고 했지만, 다른 내부 사이트에서는 Fable보다 성능이 뛰어나다고 주장했다.
  • 인프라: OpenRouter를 통해 높은 수준의 가용성이 제공되는 것은 중국산 AI 가속기로 구성된 Nvidia가 아닌 하드웨어 스택을 사용할 가능성이 있다는 추측이 제기되고 있다.

전략적 맥락

Ox Alpha의 가중치 공개 결정은 커뮤니티에서 DeepSeek과의 오픈 가중치 생태계 내 경쟁력을 유지하기 위한 전략적 조치로 해석된다. 이는 중국의 AI 연구소들이 글로벌 경쟁자들과의 경쟁에서 입지를 다지기 위해 모델 가중치를 공개하는 일련의 추세를 이어가는 것이다.

Sources

관련