ThinkingCap:优化 Qwen 3.6-27B,实现高效本地编码

ThinkingCap 是对 Qwen 3.6-27B 模型的微调,旨在将推理 token 减少 46%,同时保持相当的智能水平和基准性能。

长链式思考推理的演进

现代大语言模型的进展,尤其是自从引入像 o1 这样的推理模型后,已经转向长链式思考推理。该过程让模型通过一系列子块“自我对话”以完善答案。这些块通常遵循以下结构化模式:

  1. 理解用户请求。
  2. 逐步拆解过程。
  3. 草拟答案的各个组成部分。

虽然延长这些链的长度通常能提升准确性,但也会在智能与 token 效率之间产生权衡。一些模型,例如 Gemini 3.5 Flash,提升了智能,却需要不成比例的大量 token。业界的目标已转向构建更高质量、 更短的思考链,以更少的步骤提供相同或更好的答案。

ThinkingCap 的目标与训练

BottleCap AI 开发了 ThinkingCap,作为 Qwen 3.6-27B 模型的直接替代品,该模型因其密集架构和 GPU 兼容性而在本地 AI 编码环境中被广泛使用。

核心目标

  • 减少 Token 使用量: 在思考过程中降低推理 token 的使用量。
  • 最小化推理循环: 减少模型在思考链中重复步骤的情况。
  • 基于段落的效率: 在降低 token 数量的同时,保持最终输出质量和基准准确性。

训练方法

BottleCap AI 将训练目标聚焦于“更高效的推理”,而非单纯奖励正确性。虽然具体数据集未公开,但该过程包括使用不同随机种子进行多次运行,以在 12 项不同基准上降低噪声。

性能与基准结果

ThinkingCap 在多个基准测试中展示了与基础 Qwen 3.6-27B 模型几乎相同的准确率,同时使用的思考 token 显著更少。

  • Token 减少: 模型平均产生约 46% 更少的推理 token。
  • 一致性: 在测试中,模型保持相同的结构步骤(例如,理解请求、识别核心算法、制定算法),但会剪除对最终答案无贡献的多余步骤。
  • 延迟: token 生成的减少直接转化为更低的延迟和推理成本。

实际应用与观察

在实际测试中,无论是编码、难度数学还是逻辑谜题,ThinkingCap 始终比标准 Qwen 3.6-27B 需要更少的 token。例如,一个算法问题在基础模型上需要 3,000 个思考 token,而在 ThinkingCap 上仅需 2,200 个。

然而,性能会因任务而异:

  • 编码与逻辑: 高效且效果显著。
  • 长篇作文: 结果可能“时好时坏”,需要对同一提示进行多次运行以验证一致性。
  • 工具使用: 在某些多工具调用场景中,ThinkingCap 可能偶尔使用的 token 多于基础模型,这表明效率提升主要体现在推理密集型任务,而非简单的工具编排。

ThinkingCap 已在 Hugging Face 上以 GGUF 和 FP8 格式发布,为寻求更高效本地编码模型的用户提供了极具可及性的选择。

Sources