WeiboAI/VibeThinker
Tiny Model, Big Logic: Diversity-Driven Optimization Elicits Large-Model Reasoning Ability in VibeThinker-1.5B
解決的問題
VibeThinker 在極小的模型規模(1.5B 和 3B 參數)下提供高效率的推理能力。它挑戰了『強大推理必須依賴大型模型』的觀念,於數學、程式競賽與 STEM 推理任務中達成前沿水準的表現,同時保持極高的計算效率與極低的訓練成本。
工作原理
本專案採用稱為「譜到訊號原理(Spectrum-to-Signal Principle, SSP)」的後訓練方法。針對 1.5B 模型,此方法包含兩階段的多樣性探索蒸餾,以產生廣泛的解法,隨後透過 MaxEnt-引導策略優化(MGPO)放大正確訊號。3B 模型在此基礎上建構升級版流程,包含基於課程的監督微調、多領域強化學習以及離線自蒸餾。此外,3B 模型引入了命題級可靠性評估(CLR),於推理階段實現性能擴展。
適用對象
專為需要在有限硬體上運行的強大推理模型之開發者與研究人員設計,尤其適用於答案可驗證的任務,如程式競賽與數學競賽。
核心亮點
- 極致高效:1.5B 模型在 AIME24、AIME25、HMMT25 等特定數學基準上,顯著超越更大模型(如 DeepSeek R1)。
- 低成本訓練:1.5B 模型的開發成本約為 7,800 美元,僅為其他先進推理模型成本的一小部分。
- 可驗證推理:專為答案可明確驗證的任務設計,包括 STEM 與程式領域。
- 推理階段擴展:於測試階段利用 CLR 進一步提升數學基準上的準確率。
相關
- Dispatch
- Dispatch
- 專案
- Dispatch
- Dispatch