WeiboAI/VibeThinker

Tiny Model, Big Logic: Diversity-Driven Optimization Elicits Large-Model Reasoning Ability in VibeThinker-1.5B

解决的问题

VibeThinker 在极小的模型规模(1.5B 和 3B 参数)下提供高性能的推理能力。它挑战了‘强大推理必须依赖大模型’的观念,实现了在数学、编程竞赛和 STEM 推理任务中达到前沿水平的性能,同时保持了极高的计算效率和极低的训练成本。

工作原理

该项目采用一种名为「谱到信号原理(Spectrum-to-Signal Principle, SSP)」的后训练方法。对于 1.5B 模型,该方法包括两阶段的多样性探索蒸馏,以生成广泛的解法,随后通过 MaxEnt-引导策略优化(MGPO)放大正确信号。3B 模型在此基础上构建了升级版流程,包含基于课程的监督微调、多领域强化学习以及离线自蒸馏。此外,3B 模型引入了命题级可靠性评估(CLR),在推理阶段实现性能扩展。

适用人群

专为需要在有限硬件上运行的强大推理模型的开发者和研究人员设计,尤其适用于答案可验证的任务,如编程竞赛和数学竞赛。

核心亮点

  • 极致高效:1.5B 模型在 AIME24、AIME25、HMMT25 等特定数学基准上显著超越更大模型(如 DeepSeek R1)。
  • 低成本训练:1.5B 模型的开发成本约为 7,800 美元,仅为其他先进推理模型成本的一小部分。
  • 可验证推理:专为答案可明确验证的任务设计,包括 STEM 和编程领域。
  • 推理阶段扩展:在测试阶段利用 CLR 进一步提升数学基准上的准确率。

相关

  • Dispatch
  • Dispatch
  • 项目
  • Dispatch
  • Dispatch