MiMo V2.6 Pro の知能・性能・価格分析

TL;DR

MiMo V2.6 Pro は知能指数で 46 を達成し、人工分析のリーダーボードで上位に位置づけられ、検証されたモデルの中で 知能指数タスクあたりのコストが最も低い 一方で、生成速度はトップクラスの競合に比べて遅い。


知能指数の概要

MiMo V2.6 Pro の知能指数 (v4.3.2) = 46 – 高いスコアは、AA‑Briefcase、GDPval‑AA、AutomationBench、Terminal‑Bench 4.0、SciCode、Humanity’s Last Exam、GDP.pdf、CritPt、AA‑Omniscience、AA‑LCR の10のベンチマークスイートにおける総合的な能力を示す。この指数は、基準通過率、分析品質 Elo、プレゼンテーション Elo、幻覚ペナルティを統合して単一の数値にしている。

"人工分析知能指数 v4.3.2 は10の評価を含んでいます… スコアが高いほど良い" – 人工分析のメソドロジー。

このスコアは、DeepSeek‑V4.1 (39) を上回り、Claude Opus 5 (66.9) に近い知能を示すが、GPT‑6 Astra (57.9) や Claude Fable 5 (46.7) といった最上位モデルには及ばない。

コスト効率

知能指数タスクあたりの加重平均コスト = 1Mトークンあたり $0.0036(キャッシュヒット価格)。これは比較対象のすべてのモデルの中で最も安価であり、入出力トークンの低価格と、ベンチマークごとのトークン消費量の控えめさが要因となっている。

"MiMo v2.6 のトレーニングコストは 347万ドル、Big 5 の1億ドル以上という推定と比べてはるかに低い" – @ignoramous によるコメント。

したがって、知能指数スイート全体を実行するための総コストは非常に低く、大量処理や予算制約のある展開に魅力的である。

速度とレイテンシ

  • 出力速度: MiMo V2.6 Pro は ~X トークン/秒(ソースでは正確な数値が明示されていない)。コミュニティメンバー (@dom96) による独立テストでは、DeepSeek よりも速いが、Claude Opus 5 などのトップモデルにはまだ及ばないという。
  • 最初のトークン到達時間 (TTFT): 他の MoE モデルと同等。正確な秒数は記載されていない。
  • エンドツーエンド500トークン応答: 最速の競合より高い。TTFTは妥当だが、全体的なレイテンシは長めである。

"非常に印象的なモデルですが、依然としてトップモデルには大きく及ばない" – @dom96。

コンテキスト窓

MiMo V2.6 Pro は 大きなコンテキスト窓(正確なトークン制限は明示されていない)を備えており、長大なドキュメントを処理する必要がある検索拡張生成(RAG)ワークフローに有利である。

オープン性とライセンス

モデルは "商用利用制限あり" とマークされている。特定の条件下では商用展開が許可されるが、非商用利用は制限なし。オープンウェイト版は提供されていない。

コミュニティのフィードバック要約

  • 肯定的: ユーザーは価格性能のバランスに満足し、MiMo V2.6 Pro が「未試用者にとって検討価値のあるトップモデル」と評価している(@segmondy によるコメント)。
  • 批判的: 一部の観察者は、見出しのランク(114中1位)と実際のスコアプロットの間に乖離がある点を疑問視し、UIの不整合の可能性を示唆している(@deanc によるコメント)。
  • 比較への懸念: あるユーザーは、DeepSeek‑V4.1 が特定のタスクでは MiMo を上回る場合があるにもかかわらず、全体的な指数スコアは低いと指摘している(@egeres によるコメント)。
  • 速度への懸念: 価格は安いが、生成速度は最も速い代替案には及ばない(@dom96 によるコメント)。

結論

MiMo V2.6 Pro は 知能指数46の高い知能を、非常に低いコストで提供 しており、多少のレイテンシを許容できるコスト感度の高いアプリケーションにとって魅力的な選択肢である。大きなコンテキスト窓とエージェント型知識作業における強力なパフォーマンスが、その有用性をさらに広げているが、最も速い原始的なスループットを求めるユーザーは、他のトップクラスモデルを検討すべきだろう。

Sources

関連