WeiboAI/VibeThinker
Tiny Model, Big Logic: Diversity-Driven Optimization Elicits Large-Model Reasoning Ability in VibeThinker-1.5B
해결하는 문제
VibeThinker는 매우 작은 모델 크기(1.5B 및 3B 파라미터)에서 높은 성능의 추론 능력을 제공합니다. 거대한 모델이 필수적이라는 전제를 도전하며, 수학, 경쟁 프로그래밍, STEM 추론 분야에서 최첨단 성능을 달성하면서도 계산 효율성이 뛰어나고, 학습 비용도 저렴합니다.
작동 방식
이 프로젝트는 '스펙트럼에서 신호로(spectrum-to-signal Principle, SSP)'라는 후처리 방법론을 사용합니다. 1.5B 모델의 경우, 다양한 해법을 탐색하는 두 단계의 다중성 탐색 증류를 거친 후, MaxEnt-가이드드 정책 최적화(MGPO)를 통해 정확한 신호를 강화합니다. 3B 모델은 이에 더해 커리큘럼 기반의 지도적 피니튜닝, 다영역 강화학습, 오프라인 자기 증류를 포함한 업그레이드된 파이프라인을 사용합니다. 또한 3B 모델은 추론 시 성능을 확장하기 위해 Claim-Level Reliability Assessment(CLR)를 도입했습니다.
대상 사용자
제한된 하드웨어에서 작동하는 강력한 추론 모델이 필요한 개발자 및 연구자, 특히 경쟁 수학 및 프로그래밍과 같이 정답이 검증 가능한 작업에 집중하는 사람들을 대상으로 합니다.
주요 특징
- 극도의 효율성: 1.5B 모델은 AIME24, AIME25, HMMT25 등의 특정 수학 벤치마크에서 DeepSeek R1과 같은 더 큰 모델을 크게 능가합니다.
- 저비용 학습: 1.5B 모델은 약 7,800달러의 비용으로 개발되었으며, 다른 최첨단 추론 모델과 비교해 극히 낮은 비용입니다.
- 검증 가능한 추론: 정답이 명시적으로 검증 가능한 작업(STEM, 프로그래밍 등)에 특화되어 있습니다.
- 추론 시 확장성: 테스트 단계에서 수학 벤치마크의 정확도를 더욱 높이기 위해 CLR을 사용합니다.
관련
- Dispatch
- Dispatch
- 프로젝트
- Dispatch
- Dispatch