MiMo V2.6 Pro 智能性、性能与价格分析
TL;DR
MiMo V2.6 Pro 在人工智能分析排行榜中取得了 46 的智能指数得分,位居前列,同时在所考察的模型中提供了 每智能指数任务最低的成本;然而,其原始生成速度落后于领先竞争对手。
智能指数概览
MiMo V2.6 Pro 的智能指数(v4.3.2)= 46 – 得分越高,表示在十个基准测试套件(AA‑Briefcase、GDPval‑AA、AutomationBench、Terminal‑Bench 4.0、SciCode、Humanity’s Last Exam、GDP.pdf、CritPt、AA‑Omniscience、AA‑LCR)中的综合能力越强。该指数将评分通过率、分析质量 Elo、展示 Elo 和幻觉惩罚整合为单一数值。
"人工智能分析智能指数 v4.3.2 包含 10 项评估……分数越高越好" – 人工智能分析方法论。
该得分使 MiMo V2.6 Pro 在原始智能性上优于 DeepSeek‑V4.1(39),接近 Claude Opus 5(66.9),但低于 GPT‑6 Astra(57.9)和 Claude Fable 5(46.7)等顶尖模型。
成本效率
智能指数任务加权平均成本 = 每百万 token 0.0036 美元(缓存命中价格)。这是所有对比模型中成本最低的,得益于较低的输入/输出 token 定价以及每个基准测试的适度 token 消耗。
"MiMo v2.6 的训练成本为 347 万美元,远低于 Big 5 的 1000 万美元以上估算" – @ignoramous 的评论。
因此,运行整个智能指数套件的总成本极低,使 MiMo V2.6 Pro 成为高吞吐量或预算受限部署的吸引力选择。
速度与延迟
- 输出速度: MiMo V2.6 Pro 每秒生成 ~X 个 token(源文件未披露具体数值)。社区成员 @dom96 的独立测试显示其速度 快于 DeepSeek,但仍 慢于 Claude Opus 5 等领先模型。
- 首次 token 延迟(TTFT): 与其他 MoE 模型相当;具体秒数未列出。
- 端到端 500 token 响应时间: 高于最快竞争对手,表明尽管 TTFT 合理,但整体延迟较长。
"这是一个令人印象深刻的强大模型……但仍然远慢于领先模型" – @dom96。
上下文窗口
MiMo V2.6 Pro 提供了 大上下文窗口(具体 token 限制未说明),有利于需要处理大量文档的检索增强生成(RAG)工作流。
开放性与许可
该模型标记为 "商业使用受限" – 在特定条件下允许商业部署,非商业使用则无限制。未提供开源权重版本。
社区反馈亮点
- 正面评价: 用户赞赏其性价比,认为 MiMo V2.6 Pro 是一款 "值得探索的顶级模型",尤其适合尚未尝试过的用户(@segmondy 的评论)。
- 批评意见: 部分观察者质疑标题排名(第 1 名 / 114 模型)与实际绘制得分之间的差异,暗示可能存在 UI 不一致(@deanc 的评论)。
- 对比质疑: 有用户指出,尽管整体指数得分较低,DeepSeek‑V4.1 在某些特定任务中有时表现优于 MiMo(@egeres 的评论)。
- 速度担忧: 尽管成本更低,但其生成速度无法与最快替代方案媲美(@dom96 的评论)。
总结
MiMo V2.6 Pro 以极低的成本实现了 高智能性(AI 指数 46),使其成为对成本敏感且可容忍适度延迟的应用场景的有力选择。其大上下文窗口和在代理型知识工作中的出色表现进一步拓展了其适用范围,但若追求最快原始吞吐量,用户可能仍会偏好其他顶级模型。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch