WeiboAI/VibeThinker

Tiny Model, Big Logic: Diversity-Driven Optimization Elicits Large-Model Reasoning Ability in VibeThinker-1.5B

何を解決するか

VibeThinker は極めて小さなモデルサイズ(1.5B および 3B パラメータ)で高パフォーマンスな推論能力を提供します。巨大なモデルが必要であるという考えに挑戦し、数学、競技プログラミング、STEM推論において最先端レベルのパフォーマンスを実現しながら、計算効率が高く、トレーニングコストも抑えることができます。

仕組み

このプロジェクトは「スペクトルから信号へ(Spectrum-to-Signal Principle, SSP)」と呼ばれる後処理手法を採用しています。1.5Bモデルの場合、まず多様性を探索する2段階の蒸留により、幅広い解法を生成し、その後 MaxEnt-Guided Policy Optimization (MGPO) で正しい信号を強化します。3Bモデルは、カリキュラムベースの教師ありファインチューニング、多領域強化学習、オフライン自己蒸留を含むアップグレードされたパイプラインを採用しています。さらに、3Bモデルは推論時に性能を拡張するための Claim-Level Reliability Assessment (CLR) を導入しています。

対象ユーザー

限られたハードウェア上で動作する強力な推論モデルが必要な開発者や研究者、特に競技数学やプログラミングのように答えが検証可能なタスクに注力する人向けです。

主な特徴

  • 極めて高い効率性:1.5Bモデルは、AIME24、AIME25、HMMT25 などの特定の数学ベンチマークで、より大きなモデル(DeepSeek R1など)を大きく上回っています。
  • 低トレーニングコスト:1.5Bモデルの開発コストは約7,800ドルで、他の最先端推論モデルと比べて極めて低コストです。
  • 検証可能な推論:答えが明示的に検証可能なタスク(STEM、プログラミングなど)に特化しています。
  • 推論時のスケーリング:テストフェーズで数学ベンチマークの精度をさらに向上させるために CLR を使用しています。

関連

  • Dispatch
  • Dispatch
  • プロジェクト
  • Dispatch
  • Dispatch