MiMo V2.6 Pro の知能・性能・価格分析
TL;DR
MiMo V2.6 Pro は知能指数で 46 を達成し、人工分析のリーダーボードで上位に位置づけられ、検証されたモデルの中で 知能指数タスクあたりのコストが最も低い 一方で、生成速度はトップクラスの競合に比べて遅い。
知能指数の概要
MiMo V2.6 Pro の知能指数 (v4.3.2) = 46 – 高いスコアは、AA‑Briefcase、GDPval‑AA、AutomationBench、Terminal‑Bench 4.0、SciCode、Humanity’s Last Exam、GDP.pdf、CritPt、AA‑Omniscience、AA‑LCR の10のベンチマークスイートにおける総合的な能力を示す。この指数は、基準通過率、分析品質 Elo、プレゼンテーション Elo、幻覚ペナルティを統合して単一の数値にしている。
"人工分析知能指数 v4.3.2 は10の評価を含んでいます… スコアが高いほど良い" – 人工分析のメソドロジー。
このスコアは、DeepSeek‑V4.1 (39) を上回り、Claude Opus 5 (66.9) に近い知能を示すが、GPT‑6 Astra (57.9) や Claude Fable 5 (46.7) といった最上位モデルには及ばない。
コスト効率
知能指数タスクあたりの加重平均コスト = 1Mトークンあたり $0.0036(キャッシュヒット価格)。これは比較対象のすべてのモデルの中で最も安価であり、入出力トークンの低価格と、ベンチマークごとのトークン消費量の控えめさが要因となっている。
"MiMo v2.6 のトレーニングコストは 347万ドル、Big 5 の1億ドル以上という推定と比べてはるかに低い" – @ignoramous によるコメント。
したがって、知能指数スイート全体を実行するための総コストは非常に低く、大量処理や予算制約のある展開に魅力的である。
速度とレイテンシ
- 出力速度: MiMo V2.6 Pro は ~X トークン/秒(ソースでは正確な数値が明示されていない)。コミュニティメンバー (@dom96) による独立テストでは、DeepSeek よりも速いが、Claude Opus 5 などのトップモデルにはまだ及ばないという。
- 最初のトークン到達時間 (TTFT): 他の MoE モデルと同等。正確な秒数は記載されていない。
- エンドツーエンド500トークン応答: 最速の競合より高い。TTFTは妥当だが、全体的なレイテンシは長めである。
"非常に印象的なモデルですが、依然としてトップモデルには大きく及ばない" – @dom96。
コンテキスト窓
MiMo V2.6 Pro は 大きなコンテキスト窓(正確なトークン制限は明示されていない)を備えており、長大なドキュメントを処理する必要がある検索拡張生成(RAG)ワークフローに有利である。
オープン性とライセンス
モデルは "商用利用制限あり" とマークされている。特定の条件下では商用展開が許可されるが、非商用利用は制限なし。オープンウェイト版は提供されていない。
コミュニティのフィードバック要約
- 肯定的: ユーザーは価格性能のバランスに満足し、MiMo V2.6 Pro が「未試用者にとって検討価値のあるトップモデル」と評価している(@segmondy によるコメント)。
- 批判的: 一部の観察者は、見出しのランク(114中1位)と実際のスコアプロットの間に乖離がある点を疑問視し、UIの不整合の可能性を示唆している(@deanc によるコメント)。
- 比較への懸念: あるユーザーは、DeepSeek‑V4.1 が特定のタスクでは MiMo を上回る場合があるにもかかわらず、全体的な指数スコアは低いと指摘している(@egeres によるコメント)。
- 速度への懸念: 価格は安いが、生成速度は最も速い代替案には及ばない(@dom96 によるコメント)。
結論
MiMo V2.6 Pro は 知能指数46の高い知能を、非常に低いコストで提供 しており、多少のレイテンシを許容できるコスト感度の高いアプリケーションにとって魅力的な選択肢である。大きなコンテキスト窓とエージェント型知識作業における強力なパフォーマンスが、その有用性をさらに広げているが、最も速い原始的なスループットを求めるユーザーは、他のトップクラスモデルを検討すべきだろう。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch