Quasar 438B リリース: 欧州最高スコアの推論モデル

Quasar 438B は Artificial Analysis Intelligence Index における欧州最高スコアのモデルです

Multiverse Computing は、エンタープライズ規模のエージェントおよびコーディング向けに設計された推論モデル Quasar 438B をリリースしました。このモデルは Artificial Analysis Intelligence Index v4.1.1 で 43 点を獲得し、同ベンチマークにおける欧州のモデルとしては最高の結果となりました。計画、ツールの使用、コード実行、および大規模なコンテキストウィンドウを必要とするマルチステップのタスクを処理するように設計されており、CompactifAI API を通じて利用可能です。

パフォーマンスと知能ベンチマーク

Quasar 438B の Artificial Analysis Intelligence Index(GPQA Diamond や SciCode を含む 9 つの評価の複合指標)におけるスコア 43 は、以下のモデルを含む他のいくつかのモデルを上回っています:

  • Inkling: 42
  • NVIDIA Nemotron 3 Ultra: 38
  • Mistral Medium 3.5: 30

これらのモデルをリードしていますが、スコア 63 でインデックスをリードする Claude Opus 5 のようなフロンティアモデルには及びません。

レイテンシと応答速度

Quasar 438B は、400B+ パラメータクラスにおいて低レイテンシに最適化されています。500 トークン(思考時間を含む)を 15.3 秒で返します。他の高スコアモデルと比較すると以下の通りです:

  • Mistral Medium 3.5: 18.8 秒 (スコア: 30)
  • NVIDIA Nemotron 3 Ultra: 25.7 秒 (スコア: 36)
  • Inkling: 48.3 秒 (スコア: 42)

比較対象の中で、より高速なモデルは 3 つのみです:Nemotron 3.5 Lightning (9.4s)、Gemini 3.5 Flash-Lite (10.8s)、および Gemini 3.7 Flash (11.5s)。これらの中で、Gemini 3.7 Flash のみが、知能インデックスで Quasar を上回り、かつより高速な応答時間を提供しています。

長文コンテキストとエージェント機能

Quasar 438B は、長文コンテキスト推論およびターミナルベースのエージェント業務において強力なパフォーマンスを示しています:

  • Long-Context Reasoning (AA-LCR): Quasar は 75.0 点を獲得し、Grok 4.6 (high) と同等であり、Claude Opus 5 (75.7) および Qwen3.8 2.4T A95B (75.3) と 1 ポイント以内の差となっています。
  • Agentic Coding (Terminal-Bench v2.1): Quasar は 69.3 点を獲得し、Mistral Medium 3.5 を 18.7 ポイント、Nemotron 3 Ultra を 15.4 ポイント上回っていますが、Claude Opus 5 (89.1) には及びません。

コミュニティの批判と技術的な懐疑論

発表後、Hacker News での技術的な議論では、モデルの出自、透明性、および企業の主張に関するいくつかの懸念が点検されました。

モデルの出自と透明性

批判的な意見として、モデルがスクラッチから事前学習されたものか、既存のモデルの圧縮/ファインチューニング版であるかに関する透明性の欠如が指摘されました。パラメータ数や変更履歴のエントリに基づき、一部のユーザーは GLM 5.2 または MiniMax M3 の修正版である可能性を示唆しています。

"I think this is GLM 5.2 with parameters removed. Its advertised in their changelog as 'capabilities are identical to GLM 5.2,' it has the same two effort settings 'high' and 'max'"

"Quantum AI" の主張に対する懐疑論

Multiverse Computing の CompactifAI テクノロジーによるモデル圧縮への "quantum physics" および "tensor networks" の使用は、懐疑的な見方に直面しています。ユーザーは、現在の LLM 開発における量子アルゴリズムの有用性に疑問を呈し、同社のマーケティングを一部 "technobabble"(技術的な空言)と表現しました。

重みの公開 lack とベンチマーク

Quasar 438B は API のみで提供され、重みが公開されていないため、一部の開発者は提供されたベンチマークに不信感を示しています。"フロンティア" モデルは、"naked"(生)なオープンウェイトモデルと比較して、スコアを膨座させるために隠されたシステムプロンプトやラッパーを伴うことがよくあると指摘しています。

"When the weights are closed I don't believe any benchmark... 'Frontier' models get tested as a model + whatever secret sauce they choose to put in front."

デプロイメントと可用性

Quasar 438B は英語とスペイン語をサポートしており、CompactifAI API を通じてアクセス可能です。これにより、エンタープライズチームは、独自のインフラを管理することなく、ソフトウェア開発エージェント、テクニカルコパイロット、および研究システムにモデルを統合することが可能です。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch