Xiaomi Mimo 2.6 训练后仪表板分析

Xiaomi 推出了 Mimo 2.6 模型系列的实时训练后仪表板,为强化学习 (RL) 过程提供了前所未有的透明度。该仪表板提供了关于两个模型变体 mimo-v2.6-promimo-v2.6-flash 的训练成本、Token 吞吐量和基准测试分数的实时遥测数据。

实时训练指标与成本

Xiaomi 提供了训练后所需财务和计算投入的详细概览。截至最新的仪表板快照,两次运行的累计成本如下:

  • mimo-v2.6-pro: $740,289
  • mimo-v2.6-flash: $321,466

总运行成本合计已超过 106 万美元。训练过程涉及海量的 Token,其中 "flash" 变体处理了 378 亿个 Token,而 "pro" 变体处理了 206 亿个。

性能基准:DeepSWE v1.1

仪表板跟踪了 DeepSWE v1.1 (mini-swe-agent, avg@3) 基准测试的性能,显示出较之前版本显著的进步。

  • mimo-v2.6-pro: 62.24
  • mimo-v2.6-flash: 60.77

作为背景,社区讨论指出 Mimo v2.5 Pro 此前在 DeepSWE 1.1 上的得分为 19%,这表明 2.6 系列在编码能力上实现了质的飞跃。这使得 2.6 模型在性能层级上更接近其他前沿编码智能体,如 Fable (70%)、Kimi K3 (69%) 和 Astra (74%)。

训练数据构成与 RL 过程

Mimo 2.6 的 RL 训练在软件工程和编码任务上权重很高。在 pro 运行的第 10 步中,提示词分布为:

  • 代码: 67.7% (1,062 个提示词)
  • 视觉: 13.1% (206 个提示词)
  • 通用: 12.1% (190 个提示词)
  • 网络安全: 4.1% (64 个提示词)
  • 聊天: 3.0% (47 个提示词)

技术遥测显示了一个复杂的 RL 循环,涉及 "rollouts"(展开)、"judging"(评判)和 "rewarding"(奖励)。仪表板跟踪了诸如 actor/entropy_lossactor/pg_losstrain_infer_diff/new_infer/kl 等指标,以监控模型在训练步骤中的稳定性和发散情况。

社区见解与用户体验

报告 Mimo 系列使用体验的用户强调了其低成本和高智能带来的高投资回报率 (ROI)。

"这个模型非常强大!虽然并不完美——我遇到过一两次幻觉循环……但成本低得令人难以置信,而且我获得的智能质量相当于我主要使用 Anthropic 模型时的水平。" — @handle

从 v2.5 过渡到更新版本的开发者注意到,模型在多任务处理和设计能力上有显著提升。虽然 v2.5-pro 被描述为一种 "保守的" 编码器,只会实现最小化的解决方案,但更新版本被描述为更 "雄心勃勃",能更好地推测项目中的缺口和后续步骤。

技术观察与争议

仪表板的开放性引发了技术观察者关于训练方法的辩论:

  • 污染: 一些用户质疑在训练期间运行基准测试是否构成数据污染。
  • 蒸馏: 有人推测这些模型是从其他前沿模型中蒸馏出来的,一些用户暗示使用了 Claude 来生成训练数据。
  • 透明度: 社区在很大程度上称赞了这种迈向透明度的举措,并将其与 OpenAI 和 Anthropic 等美国实验室更不透明的训练过程进行了对比。

Sources

相关