OpenBMB/MiniCPM

MiniCPM5-1B: A SOTA 1B on-device LLM, small yet powerful.

解决的问题

MiniCPM5-1B 是一款紧凑的 1B 参数密集型 Transformer 模型,专为资源受限场景下的端侧和本地部署而设计。其目标是在同规模模型中提供最先进(SOTA)的性能,特别是在需要较小内存占用的推理、编程和工具使用工作流中。

工作原理

该模型基于标准的 LlamaForCausalLM 架构构建,通过三个阶段进行训练:基础训练、中期训练和后期训练。后期训练阶段结合了使用深度思考(deep-thinking)和混合思考(hybrid-thinking)数据的监督微调(SFT)、用于提高推理和可靠性的强化学习(RL),以及将专业 RL 教师的知识蒸馏到单个发布模型中的在线策略蒸馏(OPD)。

它具有混合推理系统,通过内置的 <think> 对话模板和 enable_thinking 开关,单个检查点既可以作为快速助手,也可以作为深思熟虑的推理器。

适用对象

  • 本地 AI 开发者:正在构建端侧助手、编程代理或工具使用工作流的人员。
  • 边缘计算用户:需要高性能 LLM 但硬件资源有限的用户。
  • ML 工程师:正在寻找能够轻松集成到 vLLM、SGLang 和 Transformers 等主流推理引擎而无需自定义内核的模型。

亮点

  • 1B 级 SOTA:在推理、代码和智能体工具使用方面优于其他同尺寸的开源模型。
  • 混合推理:在同一个模型检查点内同时支持“思考(Think)”和“不思考(No Think)”模式。
  • 标准架构:使用 LlamaForCausalLM,确保与大多数主流推理后端(vLLM、SGLang、llama.cpp 等)的兼容性。
  • 面向智能体的部署:为 Cursor 和 Claude Code 提供专门的“智能体技能(Agent Skills)”,以实现部署和微调工作流的自动化。
  • 原生工具调用:发出 XML 风格的工具调用,并在 SGLang 中提供用于 OpenAI 兼容转换的原生支持。

相关

  • 项目
  • Dispatch
  • 项目
  • 项目
  • 项目