Xiaomi Mimo 2.6 ポストトレーニングダッシュボード分析
Xiaomiは、Mimo 2.6モデルシリーズ向けのライブポストトレーニングダッシュボードを公開し、強化学習(RL)プロセスにおける前例のない透明性を提供しています。このダッシュボードでは、mimo-v2.6-proとmimo-v2.6-flashという2つのモデルバリアントについて、トレーニングコスト、トークンスループット、ベンチマークスコアに関するリアルタイムのテレメトリを提供します。
リアルタイムのトレーニングメトリクスとコスト
Xiaomiは、ポストトレーニングに必要な財務的および計算的投資の詳細な内訳を提供しています。最新のダッシュボードのスナップショット時点での、2つの実行における累積コストは以下の通りです。
- mimo-v2.6-pro: $740,289
- mimo-v2.6-flash: $321,466
合計で、実行コストは106万ドルを超えました。トレーニングプロセスには膨大なトークン量が関与しており、「flash」バリアントは合計378億トークンを処理したのに対し、「pro」バリアントは206億トークンを処理しました。
パフォーマンスベンチマーク: DeepSWE v1.1
ダッシュボードはDeepSWE v1.1 (mini-swe-agent, avg@3) ベンチマークでのパフォーマンスを追跡しており、以前のバージョンと比較して大幅な進歩を示しています。
- mimo-v2.6-pro: 62.24
- mimo-v2.6-flash: 60.77
参考までに、コミュニティの議論では、Mimo v2.5 Proが以前DeepSWE 1.1で19%のスコアを記録していたことが指摘されており、2.6シリーズでコーディング能力が大幅に飛躍したことが示されています。これにより、2.6モデルはFable (70%)、Kimi K3 (69%)、Astra (74%) といった他の最先端コーディングエージェントに近いパフォーマンス層に位置付けられます。
トレーニングデータの構成とRLプロセス
Mimo 2.6のRLトレーニングは、ソフトウェアエンジニアリングとコーディングタスクに大きく比重を置いています。pro実行のステップ10におけるプロンプトの分布は以下の通りです。
- Code: 67.7% (1,062件のプロンプト)
- Visual: 13.1% (206件のプロンプト)
- General: 12.1% (190件のプロンプト)
- Cyber: 4.1% (64件のプロンプト)
- Chat: 3.0% (47件のプロンプト)
技術的なテレメトリは、「ロールアウト」、「ジャッジング」、「リワーディング」を含む複雑なRLループを示しています。ダッシュボードは、トレーニングステップ中のモデルの安定性と発散を監視するために、actor/entropy_loss、actor/pg_loss、train_infer_diff/new_infer/kl などのメトリクスを追跡しています。
コミュニティの洞察とユーザー体験
Mimoシリーズの使用経験を報告するユーザーは、低コストかつ高い知能による投資収益率(ROI)の高さに注目しています。
"このモデルは非常に強力です!完璧ではありませんが、一度か二度ハルシネーションループに陥ったことがあります... コストは信じられないほど低く、得られる知能の質は、主にAnthropicのモデルを使用していた時と同等です。" — @handle
v2.5から新しいイテレーションに移行した開発者は、マルチタスク能力と設計能力が著しく向上していると指摘しています。v2.5-proは最小限のソリューションを実装する「保守的」なコーダーと評されていましたが、新しいバージョンはより「野心的」であり、プロジェクトのギャップや次のステップについてより良い推測を行うと評されています。
技術的な観察と論争
ダッシュボードの公開性は、トレーニング手法に関して技術的な観測筋の間で議論を巻き起こしています。
- 汚染: 一部のユーザーは、トレーニング中にベンチマークを実行することがデータ汚染にあたるのではないかと疑問を呈しています。
- 蒸留: モデルが他の最先端モデルから蒸留されているのではないかという憶測があり、一部のユーザーはトレーニングデータの生成にClaudeが使用されている可能性を示唆しています。
- 透明性: コミュニティは、OpenAIやAnthropicといった米国拠点の研究所の不透明なトレーニングプロセスとは対照的に、透明性を高めるこの動きを概ね称賛しています。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch