Quasar 438B 출시: 유럽 최고 점수의 추론 모델

Quasar 438B는 Artificial Analysis Intelligence Index에서 가장 높은 점수를 기록한 유럽 모델입니다

Multiverse Computing은 기업용 에이전트 및 코딩을 위해 설계된 추론 모델인 Quasar 438B를 출시했습니다. 이 모델은 Artificial Analysis Intelligence Index v4.1.1에서 43점을 기록하며, 해당 벤치마크에서 모든 유럽 모델 중 가장 높은 결과를 얻었습니다. 이 모델은 계획 수립, 도구 사용, 코드 실행 및 대규모 컨텍스트 창이 필요한 다단계 작업을 처리하도록 설계되었으며, CompactifAI API를 통해 사용할 수 있습니다.

성능 및 지능 벤치마크

Quasar 438B는 Artificial Analysis Intelligence Index(GPQA Diamond 및 SciCode를 포함한 9가지 평가의 복합체)에서 43점을 기록하여 다음과 같은 다른 모델들을 앞섭니다:

  • Inkling: 42
  • NVIDIA Nemotron 3 Ultra: 38
  • Mistral Medium 3.5: 30

이 모델들을 앞서고 있지만, 63점으로 인덱스를 선도하는 Claude Opus 5와 같은 프론티어 모델에는 미치지 못합니다.

지연 시간 및 응답 속도

Quasar 438B는 400B+ 파라미터급에서 낮은 지연 시간을 갖도록 최적화되었습니다. 이 모델은 500개의 토큰(생각하는 시간 포함)을 15.3초 만에 반환합니다. 다른 고득점 모델과 비교하면 다음과 같습니다:

  • Mistral Medium 3.5: 18.8초 (점수: 30)
  • NVIDIA Nemotron 3 Ultra: 25.7초 (점수: 36)
  • Inkling: 48.3초 (점수: 42)

비교 대상 중 단 세 개의 모델만이 더 빠릅니다: Nemotron 3.5 Lightning (9.4s), Gemini 3.5 Flash-Lite (10.8s), 그리고 Gemini 3.7 Flash (11.5s). 이 중 Gemini 3.7 Flash만이 지능 인덱스에서 Quasar를 능가하고 더 빠른 응답 시간을 제공합니다.

긴 컨텍스트 및 에이전트 기능

Quasar 438B는 긴 컨텍스트 추론 및 터미널 기반 에이전트 작업에서 강력한 성능을 보여줍니다:

  • Long-Context Reasoning (AA-LCR): Quasar는 75.0점을 기록하여 Grok 4.6 (high)와 대등하며, Claude Opus 5 (75.7) 및 Qwen3.8 2.4T A95B (75.3)와 1점 차이 이내로 근접합니다.
  • Agentic Coding (Terminal-Bench v2.1): Quasar는 69.3점을 기록하여 Mistral Medium 3.5를 18.7점 차이로, Nemotron 3 Ultra를 15.4점 차이로 앞서지만, Claude Opus 5 (89.1)에는 뒤처집니다.

커뮤니티 비판 및 기술적 회의론

발표 이후, Hacker News에서의 기술적 논의는 모델의 기원, 투명성 및 회사의 주장과 관련하여 몇 가지 우려를 제기했습니다.

모델 출처 및 투명성

비평가들은 이 모델이 처음부터 사전 학습되었는지, 아니면 기존 모델의 압축/미세 조정된 버전인지에 대한 투명성 부족을 지기적했습니다. 일부 사용자들은 파라미터 수와 변경 로그 항목을 근거로 이것이 GLM 5.2 또는 MiniMax M3의 수정 버전일 수 있다고 제안했습니다.

"I think this is GLM 5.2 with parameters removed. Its advertised in their changelog as 'capabilities are identical to GLM 5.2,' it has the same two effort settings 'high' and 'max'"

"Quantum AI" 주장에 대한 회의론

Multiverse Computing의 CompactifAI 기술을 통한 모델 압축에 "quantum physics" 및 "tensor networks"를 사용하는 것에 대해 회의론이 제기되었습니다. 사용자들은 현재 LLM 개발에서 양자 알고리즘의 유용성에 의문을 제기했으며, 회사의 일부 마케팅을 "technobabble"로 규정했습니다.

폐쇄형 가중치 및 벤치마크

Quasar 438B는 API 전용이며 가중치가 공개되지 않기 때문에, 일부 개발자들은 제공된 벤치마크에 대한 불신을 표현했습니다. 그들은 "프론티어" 모델들이 종종 "naked" 오픈 웨이트 모델과 비교했을 때 점수를 부풀리기 위해 숨겨진 시스템 프롬프트나 래퍼를 포함하는 경우가 많다고 언급했습니다.

"When the weights are closed I don't believe any benchmark... 'Frontier' models get tested as a model + whatever secret sauce they choose to put in front."

배포 및 가용성

Quasar 438B는 영어와 스페인어를 지원하며, CompactifAI API를 통해 접근할 수 있습니다. 이를 통해 기업용 팀이 자체 인프라를 관리하지 않고도 소프트웨어 개발 에이전트, 기술 코파일럿, 연구 시스템에 모델을 통합할 수 있습니다.

Sources

관련