Xiaomi Mimo 2.6 訓練後儀表板分析

Xiaomi 推出了 Mimo 2.6 模型系列的即時訓練後儀表板,為強化學習 (RL) 過程提供了前所未有的透明度。該儀表板提供兩個模型變體:mimo-v2.6-promimo-v2.6-flash 的訓練成本、Token 吞吐量和基準測試分數的即時遙測數據。

即時訓練指標與成本

Xiaomi 提供了訓練後所需財務與計算投入的詳細概覽。截至最新的儀表板快照,兩次運行的累計成本如下:

  • mimo-v2.6-pro: $740,289
  • mimo-v2.6-flash: $321,466

總計運行成本已超過 106 萬美元。訓練過程涉及大量的 Token 處理量,其中「flash」變體處理了 378 億個 Token,而「pro」變體則處理了 206 億個。

效能基準測試:DeepSWE v1.1

儀表板追蹤了 DeepSWE v1.1 (mini-swe-agent, avg@3) 基準測試的效能,顯示出相較於先前版本有顯著進步。

  • mimo-v2.6-pro: 62.24
  • mimo-v2.6-flash: 60.77

作為背景參考,社群討論指出 Mimo v2.5 Pro 先前在 DeepSWE 1.1 的得分為 19%,這顯示 2.6 系列在程式編寫能力上有大幅躍進。這使得 2.6 模型在效能層級上更接近其他前沿程式編寫代理,如 Fable (70%)、Kimi K3 (69%) 和 Astra (74%)。

訓練資料組成與 RL 過程

Mimo 2.6 的 RL 訓練高度偏重於軟體工程與程式編寫任務。在 pro 運行的第 10 步中,提示詞分佈如下:

  • 程式碼 (Code): 67.7% (1,062 個提示詞)
  • 視覺 (Visual): 13.1% (206 個提示詞)
  • 通用 (General): 12.1% (190 個提示詞)
  • 網路安全 (Cyber): 4.1% (64 個提示詞)
  • 聊天 (Chat): 3.0% (47 個提示詞)

技術遙測顯示了一個複雜的 RL 循環,涉及「rollouts」、「judging」和「rewarding」。儀表板追蹤了諸如 actor/entropy_lossactor/pg_losstrain_infer_diff/new_infer/kl 等指標,以監控模型在訓練步驟中的穩定性與發散情況。

社群見解與使用者體驗

回報 Mimo 系列使用體驗的使用者強調,由於低成本與高智慧,該模型具有極高的投資報酬率 (ROI)。

「這個模型非常強大!雖然不完美——我曾一兩次遇到幻覺循環……但成本低得令人難以置信,而且我獲得的智慧品質相當於我之前主要使用 Anthropic 模型時的水準。」

從 v2.5 轉向較新版本的開發者注意到,在多工處理與設計能力上有顯著改善。雖然 v2.5-pro 被描述為一個「保守」的程式設計師,只實作最小化的解決方案,但較新的版本被描述為更具「野心」,能對專案中的缺口與後續步驟做出更好的推測。

技術觀察與爭議

儀表板的開放性引發了技術觀察家對於訓練方法的辯論:

  • 污染 (Contamination): 一些使用者質疑在訓練期間執行基準測試是否構成資料污染。
  • 蒸餾 (Distillation): 有人推測這些模型是從其他前沿模型中蒸餾出來的,一些使用者暗示使用了 Claude 來生成訓練資料。
  • 透明度 (Transparency): 社群在很大程度上讚揚了這種邁向透明化的舉措,並將其與 OpenAI 和 Anthropic 等美國實驗室較為封閉的訓練過程進行了對比。

Sources

相關